VibeVoice

A frontier long-form, multi-speaker TTS using ultra-low-rate continuous tokenizers (7.5 Hz) with next-token diffusion to synthesize coherent conversations up to ~90 minutes; a realtime 0.5B variant supports streaming with ~200 ms first-audio latency.

Explore more models