AI 領域精選文章翻譯
by AIDAS Laboratory / arXiv:2604.00007

原文連結: https://arxiv.org/abs/2604.00007
AIDAS 實驗室(AIDAS Laboratory)的研究團隊近日發表了名為 Dynin-Omni 的新型基礎模型。這不僅僅是另一個多模態模型,它是首個將「文本、圖像、視頻與語音」的理解與生成,完整封裝在單一掩碼擴散(Masked Diffusion)架構中的全模態(Omnimodal)模型。
目前主流的統一模型(如 GPT-4o 或 Gemini 系列)大多基於自回歸架構,將異構模態序列化後進行預測。然而,自回歸在生成非序列性內容(如圖像或視頻)時效率受限,且難以進行迭代優化。
Dynin-Omni 提出了一種全新的建模範式:全模態離散擴散。它將所有輸入(無論是圖像像素還是語音波形)映射到一個共享的離散 token 空間,然後通過 Transformer 骨幹網路對被遮蔽(Masked)的 token 進行去噪。這種做法允許模型在雙向上下文(Bidirectional context)下,通過迭代式、信心導向的精煉過程(Iterative confidence-based refinement)來生成內容,極大地提升了內容的連貫性與質量。
Dynin-Omni 的核心優勢在於其單一性。它不需要為特定模態準備外部解碼器,所有功能都在同一個 Transformer backbone 中實現。研究團隊在 19 個多模態基準測試中評估了 Dynin-Omni,其表現令人矚目:
這些數據證明,掩碼擴散架構在處理複雜的跨模態任務(如「語音轉圖像」或「視頻轉描述」)時,具有比自回歸架構更高的靈活性與潛力。
為了讓模型同時掌握如此多樣的技能,團隊採用了多階段訓練策略。首先通過模型合併(Model-merging)進行模態擴充,隨後進行全模態對齊訓練。這有效地緩解了所謂的「災難性遺忘」或模態間的干擾問題,確保了模型在處理新模態時,依然能保持強大的語言邏輯能力。
Dynin-Omni 的出現,標誌著 AI 模型架構之爭進入了下半場。在過去兩年中,Transformer 結合自回歸幾乎統治了所有大模型。但 Dynin-Omni 的實驗結果向我們展示了另一條道路:擴散模型(Diffusion Models)不再只是「生圖」的專利,它也可以成為統一理解與生成的基礎框架。
這種架構變革對於具身智能(Embodied AI)和實時交互系統尤為重要。掩碼擴散允許並行化處理與局部精煉,這在需要快速反應或高精度視覺回饋的機器人任務中,可能比「一字一字預測」的自回歸架構更具優勢。未來,全模態模型是否會全面倒向擴散架構,Dynin-Omni 給出了一個極具說服力的肯定開端。