ICML 2025
MATS: An Audio Language Model under Text-only Supervision
An audio language model trained under text-only supervision, with Santa for transferring audio embeddings into the text embedding space while preserving audio semantics.