Qwen Audio Agent
Runtime voice agent thời gian thực giữ cuộc hội thoại tiếp tục trong khi backend agent chạy công việc và gọi tool ở nền.
Xem thêm từ README.mdThu gọn README.md
Đánh giá chi tiết
Tổng quan
Qwen Audio Agent là runtime giọng nói thời gian thực với một ý tưởng rõ ràng: cuộc trò chuyện không nên đứng hình chỉ vì agent đang tìm dữ liệu, gọi tool hoặc xử lý tác vụ dài. Lớp voice frontend tiếp tục nghe và phản hồi, trong khi công việc được giao cho backend agent; khi hoàn tất, kết quả quay lại đúng cuộc hội thoại.
Dự án không bắt buộc một agent duy nhất. Nó dùng Agent Client Protocol cho OpenCode, OpenClaw, Qoder, Kimi Code và adapter cho các backend khác như Codex, Claude Code, Hermes hoặc ACP stdio tùy cấu hình. Người dùng có thể chạy desktop app, web, TUI hoặc CLI, và có chế độ frontend-only nếu chưa nối backend agent.
Tính năng chính
- Realtime voice gateway tách frontend hội thoại và backend task.
- Hỗ trợ ACP session, permission prompt, cancellation và tiếp tục project session.
- Desktop app macOS, web UI, TUI, CLI và user service chạy nền.
- Lựa chọn DashScope hoặc speech-to-speech service tự vận hành.
- Memory/profile cục bộ dưới
~/.config/qwaudio/. - Cài/reuse OpenCode, OpenClaw và các adapter theo phiên bản pin.
- Log JSONL có redaction và rotation.
Điểm mạnh
Kiến trúc tách voice khỏi task giúp trải nghiệm tự nhiên hơn voice bot request-response. Test source bao phủ nhiều chi tiết khó: một live gateway mỗi config, ownership của voice client, permission timeout, ACP model selection, session reattach, secret redaction, service lifecycle và desktop navigation.
Tôi chạy toàn bộ npm test và build web ở Node 22.22.2; các workspace server, web, TUI, desktop và CLI đều vượt qua, sau đó Vite build thành công. Đây là bằng chứng unit/mock và build mạnh cho commit v1.4.2; chưa phải cuộc gọi live qua microphone, DashScope hoặc backend agent thật.
Hạn chế
Ranh giới “local” phụ thuộc cấu hình. Profile và task file được giữ trên máy, nhưng khi dùng DashScope thì audio/model request đi tới cloud. Chế độ speech-to-speech local cần tự vận hành model và phần cứng phù hợp. Người dùng phải đọc privacy/config docs để biết dữ liệu nào đi qua từng dịch vụ.
Backend agent vẫn có quyền riêng của nó. Nếu bật full permission cho project không đáng tin cậy, voice layer không biến shell/file operation thành an toàn. Linux và Windows có khác biệt về half/full duplex; chất lượng VAD, interruption, latency và ngôn ngữ cần test trên thiết bị thật. Nhịp phát hành từ v0.9 lên v1.4 trong thời gian rất ngắn cũng báo hiệu UX và config còn biến động.
Phù hợp khi nào
Qwen Audio Agent phù hợp với developer muốn ghép voice liên tục vào coding agent hoặc trợ lý chạy công việc nền mà không tự xây gateway, session và permission flow. Nên bắt đầu frontend-only hoặc sandbox project, sau đó mới nối backend có quyền sửa file/chạy lệnh.