← Back to all articles
arXiv cs.AIOctober 7, 2026

UniAE-MoE: A Unified Audio Encoder via Mixture of Experts

Excerpt

arXiv:2609.39199v2 Announce Type: replace-cross Abstract: Large Audio Language Models (LALMs) rely on effective audio encoders for multi-task performance. We introduce UniAE-MoE, a unified audio encoder designed to model cross-domain audio representations and achieve outstanding downstream understanding performance via a Mixture-of-Experts (MoE) architecture. Specifically, we explore mainstream audio encoders and integrate those from Qwen2-Audio and Audio-Flamingo 3, which demonstrate superior d