AudioX

A unified anything-to-audio generator with Multimodal Adaptive Fusion that integrates text, video, image, and audio conditions; trained on the 7M-sample IF-caps dataset, it delivers strong results especially for text-to-audio and text-to-music.

Explore more models