Parlor
AI multimodal thời gian thực chạy hoàn toàn on-device, hỗ trợ hội thoại giọng nói và hình ảnh tự nhiên mà không cần đẩy dữ liệu lên cloud.
Xem thêm từ README.mdThu gọn README.md
Đánh giá chi tiết
Tổng quan
Parlor là một dự án AI multimodal chạy hoàn toàn on-device, cho phép người dùng nói chuyện với AI bằng giọng nói và hình ảnh theo thời gian thực. Thay vì gửi toàn bộ audio, video và ngữ cảnh lên cloud, Parlor tận dụng các model nhỏ đủ mạnh để xử lý trực tiếp trên máy, nhắm đến trải nghiệm tự nhiên hơn và chi phí vận hành gần như bằng 0.
Điểm mạnh của Parlor nằm ở hướng tiếp cận thực dụng: voice, vision, barge-in và streaming đều được tối ưu để dùng cục bộ trên Apple Silicon hoặc Linux có GPU phù hợp. Đây là kiểu tool rất đáng chú ý nếu bạn quan tâm đến tương lai của AI assistant riêng tư và chạy local.
Tính năng chính
- Hội thoại giọng nói và hình ảnh theo thời gian thực
- Chạy on-device với Gemma 4 E2B và Kokoro, giảm phụ thuộc vào cloud
- Hỗ trợ interrupt giữa chừng khi AI đang nói
- Streaming TTS theo câu để phản hồi nhanh hơn
- Có thể dùng cho học ngôn ngữ, trợ lý cá nhân hoặc demo multimodal local AI
Ai nên dùng
Hợp với người thích local AI, developer nghiên cứu multimodal assistant, hoặc ai muốn thử voice + vision assistant trên máy riêng mà không tốn phí server.
Hạn chế
- Hiện là research preview, chưa phải sản phẩm polished
- Yêu cầu phần cứng khá cụ thể để đạt realtime tốt
- Setup vẫn thiên kỹ thuật hơn là cài phát chạy luôn