🚀 Lộ trình Chính thức của Hermes: Điều gì Sắp Diễn ra?
Lộ trình chính thức của Hermes: phản ứng tin nhắn, máy chủ API tương thích OpenAI, hỗ trợ phát trực tuyến
Hermes Agent công bố công khai kế hoạch phát triển của mình trong thư mục .plans trên GitHub, vì vậy bạn luôn có thể nhìn vào bên trong và biết chính xác đội ngũ đang xây dựng điều gì tiếp theo.
💬 Phản ứng tin nhắn: Tapbacks trên máy tính để bàn
Nó là gì: Hãy nghĩ đến tính năng “chạm hai lần để thả tim” trên Instagram hoặc iMessage. Bạn chạm vào một tin nhắn, và một biểu tượng cảm xúc nhỏ (👍, ❤️, 😂, v.v.) sẽ hiện lên trên đó. Hermes đang mang trải nghiệm tương tự này đến với bảng ghi chép trên máy tính để bàn của mình. Hiện tại, phản ứng đã tồn tại trên các nền tảng như Telegram, Slack và iMessage — nhưng ứng dụng máy tính để bàn lại là ngoại lệ. Kế hoạch này sẽ lấp đầy khoảng trống đó.
Lợi ích cho người dùng: Thay vì phải gõ “đúng vậy” hoặc “buồn cười thật”, bạn chỉ cần chạm vào một tin nhắn và phản ứng. Nhanh hơn, biểu cảm hơn và cảm giác tự nhiên hơn. Tác nhân (agent) cũng có thể phản ứng với tin nhắn của bạn, vì vậy bạn sẽ nhận được phản hồi trực quan nhanh chóng như “đã rõ” hoặc “👍” mà không cần một câu trả lời văn bản đầy đủ. Đây là một thay đổi nhỏ nhưng làm cho cuộc trò chuyện trở nên “người” hơn rất nhiều.
Tiến độ hiện tại: Nền tảng đã vững chắc. Công cụ dành cho tác nhân (send_message(action="react")) đã tồn tại và quy ước nhận dữ liệu để đọc phản ứng đã được thiết lập trên các nền tảng. Phía máy tính để bàn là phần duy nhất còn trống — kế hoạch ghi rõ rằng việc tìm kiếm grep -ri reaction trong ứng dụng máy tính để bàn chỉ tìm thấy các trái tim của lớp phủ thú cưng. Vì vậy, phần lõi đã sẵn sàng; công việc giao diện người dùng (UI) là bước tiếp theo.
🌐 Máy chủ API tương thích OpenAI
Nó là gì: Hãy tưởng tượng tác nhân Hermes của bạn như một ổ cắm điện đa năng. Kế hoạch này bổ sung một ổ cắm tiêu chuẩn (một REST API tương thích OpenAI) mà bất kỳ giao diện trò chuyện nào cũng có thể cắm vào. Thay vì bị giới hạn trong giao diện riêng của Hermes, bạn có thể sử dụng Open WebUI, LobeChat, LibreChat hoặc bất kỳ giao diện trò chuyện phổ biến nào khác “nói ngôn ngữ OpenAI”.
Lợi ích cho người dùng: Sự lựa chọn và sự quen thuộc. Nếu bạn yêu thích giao diện của Open WebUI, bạn có thể trỏ nó đến backend Hermes của mình và tiếp tục sử dụng giao diện đó. Bạn có được sức mạnh của Hermes (quản lý phiên, sử dụng công cụ, hỗ trợ đa nền tảng) được bọc trong bất kỳ giao diện nào bạn đã biết và yêu thích. Nó cũng làm cho Hermes tương thích ngay lập tức với một hệ sinh thái khổng lồ các công cụ và tích hợp hiện có.
Tiến độ hiện tại: Đây vẫn đang trong giai đoạn thiết kế. Kế hoạch đưa ra hai phương án kiến trúc và đề xuất rõ ràng Phương án A: xây dựng nó như một bộ chuyển đổi nền tảng gateway mới. Cách tiếp cận này tái sử dụng tất cả cơ sở hạ tầng gateway hiện có (xác thực, phiên, xây dựng ngữ cảnh), nghĩa là ít mã cần bảo trì hơn và ít lỗi hơn. Các điểm cuối (endpoint) đã được xác định (/v1/chat/completions, /v1/models, /health), nhưng chưa có mã nào được viết.
⚡ Truyền phát phản hồi LLM (Streaming)
Nó là gì: Bạn đã bao giờ thấy ChatGPT gõ câu trả lời từng chữ một chưa? Đó là truyền phát (streaming). Kế hoạch này bổ sung cách truyền tải từng token (token-by-token) tương tự cho Hermes trên tất cả các nền tảng — CLI, Telegram, Discord và máy chủ API trong tương lai. Thay vì nhìn chằm chằm vào vòng xoay “đang suy nghĩ…” trong mười giây, bạn sẽ thấy phản hồi hiện ra trực tiếp.
Lợi ích cho người dùng: Tốc độ cảm nhận và phản hồi. Ngay cả khi tổng thời gian tạo phản hồi là như nhau, việc nhìn thấy văn bản xuất hiện có cảm giác nhanh hơn đáng kể. Nó cũng cho phép bạn nắm bắt hướng đi của tác nhân sớm và ngắt lời nếu nó đi sai hướng. Kế hoạch có cờ tính năng (streaming.enabled: true trong cấu hình), vì vậy đây là tính năng chọn tham gia (opt-in) — nếu bạn thích hành vi hiện tại, không có gì thay đổi cho bạn.
Tiến độ hiện tại: Kiến trúc đã được xác định rõ ràng: một hệ thống dựa trên callback (gọi lại) trong đó tác nhân AI phát ra các phần văn bản (text deltas) vào một hàng đợi an toàn cho luồng (thread-safe queue), và mỗi nền tảng (CLI, gateway, máy chủ API) tiêu thụ hàng đợi đó theo cách riêng của mình. Kế hoạch nêu rõ rằng lõi tác nhân không phụ thuộc vào nền tảng và có cơ chế suy giảm chất lượng một cách duyên dáng (graceful degradation) được tích hợp sẵn — nếu nhà cung cấp không hỗ trợ truyền phát, nó sẽ âm thầm quay lại đường dẫn không truyền phát. Cái này có vẻ gần nhất với việc sẵn sàng triển khai.
🔮 Tất cả những điều này có nghĩa là gì
Ba kế hoạch này vẽ nên một bức tranh rõ ràng: Hermes đang trưởng thành từ một công cụ mạnh mẽ nhưng chuyên biệt thành một nền tảng linh hoạt, có khả năng tương tác. Phản ứng tin nhắn làm cho cuộc trò chuyện trở nên “người” hơn. API tương thích OpenAI biến Hermes thành một backend có thể thay thế trực tiếp (drop-in) cho toàn bộ hệ sinh thái giao diện trò chuyện. Truyền phát làm cho mọi tương tác trở nên nhanh nhạy và phản hồi tốt.
Cùng nhau, chúng hạ thấp rào cản gia nhập và nâng cao giới hạn những gì bạn có thể làm. Bạn sẽ có thể sử dụng Hermes với giao diện yêu thích của mình, thấy câu trả lời của nó hiện ra trong thời gian thực và phản ứng với tin nhắn chỉ bằng một cú chạm — tất cả mà không cần học một giao diện mới.
Lộ trình là một tài liệu sống. Nhóm nghiên cứu công bố các kế hoạch này một cách công khai và chúng phát triển dựa trên phản hồi của cộng đồng và cách sử dụng thực tế. Vì vậy, hãy thường xuyên quay lại xem — những gì “sắp diễn ra” hôm nay có thể đã nằm trong tay bạn vào ngày mai. Và nếu bạn có ý tưởng, thư mục .plans là công khai vì một lý do: tiếng nói của bạn có thể định hình những gì sẽ xuất hiện tiếp theo.
📖 Tài liệu chính thức
この記事は Hermes Agent のTài liệu chính thứcに基づいています:GitHub ›/tree/main/.plans