VibeVoice
Họ model voice AI mã nguồn mở của Microsoft: ASR xử lý audio 60 phút liền mạch, TTS tạo giọng nói 90 phút với 4 speaker, Realtime TTS 300ms latency. 28K+ stars.
Xem thêm từ README.mdThu gọn README.md
Đánh giá chi tiết
Tổng quan
VibeVoice là bộ model voice AI mã nguồn mở từ Microsoft Research, gồm 3 model chính: ASR (speech-to-text), TTS (text-to-speech), và Realtime TTS. Điểm nổi bật là khả năng xử lý audio dài bất thường: ASR xử lý 60 phút trong một lần chạy, TTS tạo giọng nói lên đến 90 phút liên tục.
Tính năng chính
- VibeVoice-ASR (7B): nhận audio tối đa 60 phút, xuất transcription có cấu trúc gồm ai nói (speaker diarization), nói lúc nào (timestamps), và nói gì (content). Hỗ trợ 50+ ngôn ngữ, cho phép truyền hotwords để cải thiện nhận dạng thuật ngữ chuyên ngành
- VibeVoice-TTS (1.5B): tạo giọng nói lên đến 90 phút, hỗ trợ 4 speaker trong cùng một đoạn hội thoại, tự nhiên và có cảm xúc. Hỗ trợ tiếng Anh, tiếng Trung và cross-lingual
- VibeVoice-Realtime (0.5B): TTS nhẹ chỉ 0.5B params, latency khoảng 300ms, nhận streaming text input, tạo giọng nói liên tục khoảng 10 phút. Có 9 ngôn ngữ và 11 giọng tiếng Anh khác style
- Tất cả model đều dùng continuous speech tokenizer ở frame rate cực thấp (7.5 Hz), giữ chất lượng audio nhưng tăng hiệu suất xử lý chuỗi dài
Stack kỹ thuật
Python, dựa trên LLM + diffusion head (next-token diffusion framework). Weights trên Hugging Face, tích hợp sẵn với Transformers library (từ v5.3.0). Hỗ trợ vLLM cho inference nhanh hơn. Có code finetuning cho ASR. MIT license.
Điểm mạnh
- Xử lý audio dài vượt trội: 60 phút ASR trong single pass, không cần cắt chunk rồi ghép lại
- ASR kết hợp 3-in-1: nhận dạng giọng nói + phân biệt speaker + timestamp, không cần pipeline riêng
- Hotwords customization: truyền tên riêng, thuật ngữ chuyên ngành để ASR nhận dạng chính xác hơn
- Tích hợp Hugging Face Transformers chính thức, model weights public trên HF
- Realtime 0.5B đủ nhẹ để deploy trên consumer hardware
- Technical report công khai trên arXiv
Hạn chế
- TTS code đã bị remove khỏi repo do phát hiện sử dụng sai mục đích (deepfake concerns). Model weights vẫn có trên HF nhưng playground bị disable
- Chưa có API hosted, phải tự deploy (trừ ASR có playground demo)
- Repo còn khá mới (tạo 08/2025), 117 open issues
- TTS chỉ hỗ trợ tiếng Anh và tiếng Trung, chưa có tiếng Việt hay các ngôn ngữ Đông Nam Á
- Cần GPU mạnh cho inference, đặc biệt ASR 7B
Phù hợp khi nào
Khi cần xử lý audio dài (podcast, meeting recording, hội nghị) mà không muốn dùng API trả phí. ASR đặc biệt hữu ích cho transcription có phân biệt speaker. Realtime TTS phù hợp cho chatbot voice hoặc ứng dụng cần giọng nói real-time.