🎵 Âm thanh & Nhạc•Mã nguồn mở•Đang hoạt động

VibeVoice

Họ model voice AI mã nguồn mở của Microsoft: ASR xử lý audio 60 phút liền mạch, TTS tạo giọng nói 90 phút với 4 speaker, Realtime TTS 300ms latency. 28K+ stars.

#vibevoice
Danh mục
🎵 Âm thanh & Nhạc
Giá
Mã nguồn mở
GitHub Stars
⭐ 54,602
Ngôn ngữ
Python
License
MIT
Ngày thêm
2026-03-30
Tóm tắt từ README GitHub
🎙️ VibeVoice: Open-Source Frontier Voice AI 📰 News 2026-09-03: 🚀 We released VibeVoice-ASR-Streaming , a unified streaming ASR model that continuously transcribes ''who said what'' as speech arrives, with support for customized hotwords and 10 languages. [ Demo ] [ Models ] [ Report ] 2026-07-23: ⚡ We released VibeVoice-ASR-BitNet , an edge CPU inference engine for VibeVoice-ASR. Through heterogeneous quantization (I8 S + I2 S), the model is compressed from 4.62 GB to 1.58 GB with real-time inference (RTF Code ] [ Models ] [ Report ] 2026-03-12: 🚀 VibeVoice-ASR is now integrated into Azure AI Foundry Labs ! You can now explore and test our unified speech-to-text capabilities directly through Microsoft Foundry. 2026-03-06: 🚀 VibeVoice ASR is now part of a Transformers release ! You can now use our speech recognition model directly through the Hugging Face Transformers library for seamless integration into your projects. 2026-01-21: 📣 We open-sourced VibeVoice-ASR , a unified speech-to-text model designed to handle 60-minute long-form audio in a single pass, generating structured transcriptions containing Who (Speaker), When (Timestamps), and What (Content), with support
Xem thêm từ README.md

Đánh giá chi tiết

Tổng quan

VibeVoice là bộ model voice AI mã nguồn mở từ Microsoft Research, gồm 3 model chính: ASR (speech-to-text), TTS (text-to-speech), và Realtime TTS. Điểm nổi bật là khả năng xử lý audio dài bất thường: ASR xử lý 60 phút trong một lần chạy, TTS tạo giọng nói lên đến 90 phút liên tục.

Tính năng chính

  • VibeVoice-ASR (7B): nhận audio tối đa 60 phút, xuất transcription có cấu trúc gồm ai nói (speaker diarization), nói lúc nào (timestamps), và nói gì (content). Hỗ trợ 50+ ngôn ngữ, cho phép truyền hotwords để cải thiện nhận dạng thuật ngữ chuyên ngành
  • VibeVoice-TTS (1.5B): tạo giọng nói lên đến 90 phút, hỗ trợ 4 speaker trong cùng một đoạn hội thoại, tự nhiên và có cảm xúc. Hỗ trợ tiếng Anh, tiếng Trung và cross-lingual
  • VibeVoice-Realtime (0.5B): TTS nhẹ chỉ 0.5B params, latency khoảng 300ms, nhận streaming text input, tạo giọng nói liên tục khoảng 10 phút. Có 9 ngôn ngữ và 11 giọng tiếng Anh khác style
  • Tất cả model đều dùng continuous speech tokenizer ở frame rate cực thấp (7.5 Hz), giữ chất lượng audio nhưng tăng hiệu suất xử lý chuỗi dài

Stack kỹ thuật

Python, dựa trên LLM + diffusion head (next-token diffusion framework). Weights trên Hugging Face, tích hợp sẵn với Transformers library (từ v5.3.0). Hỗ trợ vLLM cho inference nhanh hơn. Có code finetuning cho ASR. MIT license.

Điểm mạnh

  • Xử lý audio dài vượt trội: 60 phút ASR trong single pass, không cần cắt chunk rồi ghép lại
  • ASR kết hợp 3-in-1: nhận dạng giọng nói + phân biệt speaker + timestamp, không cần pipeline riêng
  • Hotwords customization: truyền tên riêng, thuật ngữ chuyên ngành để ASR nhận dạng chính xác hơn
  • Tích hợp Hugging Face Transformers chính thức, model weights public trên HF
  • Realtime 0.5B đủ nhẹ để deploy trên consumer hardware
  • Technical report công khai trên arXiv

Hạn chế

  • TTS code đã bị remove khỏi repo do phát hiện sử dụng sai mục đích (deepfake concerns). Model weights vẫn có trên HF nhưng playground bị disable
  • Chưa có API hosted, phải tự deploy (trừ ASR có playground demo)
  • Repo còn khá mới (tạo 08/2025), 117 open issues
  • TTS chỉ hỗ trợ tiếng Anh và tiếng Trung, chưa có tiếng Việt hay các ngôn ngữ Đông Nam Á
  • Cần GPU mạnh cho inference, đặc biệt ASR 7B

Phù hợp khi nào

Khi cần xử lý audio dài (podcast, meeting recording, hội nghị) mà không muốn dùng API trả phí. ASR đặc biệt hữu ích cho transcription có phân biệt speaker. Realtime TTS phù hợp cho chatbot voice hoặc ứng dụng cần giọng nói real-time.

VibeVoice | Atlas for AI