🤖 Trợ lý AI•Mã nguồn mở•Beta

Parlor

AI multimodal thời gian thực chạy hoàn toàn on-device, hỗ trợ hội thoại giọng nói và hình ảnh tự nhiên mà không cần đẩy dữ liệu lên cloud.

#parlor
Danh mục
🤖 Trợ lý AI
Giá
Mã nguồn mở
GitHub Stars
⭐ 2,072
Ngôn ngữ
Python
License
Apache-2.0
Ngày thêm
2026-04-11
Tóm tắt từ README GitHub
Parlor Fully on-device, real-time multimodal AI, with features similar to GPT-Live. https://github.com/user-attachments/assets/0833b0ec-9e48-46dc-9fde-c3ac4a70abf9 Research preview. This is an early experiment. Expect rough edges and bugs. Why? I'm self-hosting a totally free voice AI on my home server to help people learn speaking English. It has hundreds of monthly active users, and I spent weeks improving it until it's almost on par with ChatGPT Advanced Voice. Then, my heart broke when OpenAI released GPT-Live, which is miles ahead of ChatGPT Advanced Voice. GPT-Live is so good that I use it almost every day. It made my app feel obsolete. I either need to redirect my users to GPT-Live, or update the app to match it. I chose to try, with the additional constraint that it had to run 100% locally on my MacBook M3 Pro. My first attempt was to fine-tune Gemma 4 12B to behave like a full-duplex model. Something like grafting a decision tick + speech head to the model. It failed after multiple trials. For now, I think a classic cascade system is still better. We just need to wait until a benevolent frontier AI company releases a full-duplex model that's on par with GPT-Live. A
Xem thêm từ README.md

Đánh giá chi tiết

Tổng quan

Parlor là một dự án AI multimodal chạy hoàn toàn on-device, cho phép người dùng nói chuyện với AI bằng giọng nói và hình ảnh theo thời gian thực. Thay vì gửi toàn bộ audio, video và ngữ cảnh lên cloud, Parlor tận dụng các model nhỏ đủ mạnh để xử lý trực tiếp trên máy, nhắm đến trải nghiệm tự nhiên hơn và chi phí vận hành gần như bằng 0.

Điểm mạnh của Parlor nằm ở hướng tiếp cận thực dụng: voice, vision, barge-in và streaming đều được tối ưu để dùng cục bộ trên Apple Silicon hoặc Linux có GPU phù hợp. Đây là kiểu tool rất đáng chú ý nếu bạn quan tâm đến tương lai của AI assistant riêng tư và chạy local.

Tính năng chính

  • Hội thoại giọng nói và hình ảnh theo thời gian thực
  • Chạy on-device với Gemma 4 E2B và Kokoro, giảm phụ thuộc vào cloud
  • Hỗ trợ interrupt giữa chừng khi AI đang nói
  • Streaming TTS theo câu để phản hồi nhanh hơn
  • Có thể dùng cho học ngôn ngữ, trợ lý cá nhân hoặc demo multimodal local AI

Ai nên dùng

Hợp với người thích local AI, developer nghiên cứu multimodal assistant, hoặc ai muốn thử voice + vision assistant trên máy riêng mà không tốn phí server.

Hạn chế

  • Hiện là research preview, chưa phải sản phẩm polished
  • Yêu cầu phần cứng khá cụ thể để đạt realtime tốt
  • Setup vẫn thiên kỹ thuật hơn là cài phát chạy luôn
Parlor | Atlas for AI