UniversalRAG

一個 RAG 搞定文字、圖片、表格與影片——UniversalRAG 模態路由設計深度解析

這篇文章是「Advanced RAG 架構思考」系列的第三篇技術解析,對應的綜述概覽在這裡。本篇聚焦 UniversalRAG(arXiv:2504.20734),解析模態差距問題的理論基礎、模態路由的設計邏輯,以及在 10 個 benchmark 上的全面驗證。 前言:一個問題,三種可能的答案來源 # 給你一個問題:「USNS Carl Brashear 軍艦下水典禮上懸掛的是什麼顏色的氣球?」 這個問題的答案,不在任何文字段落裡。答案在一張典禮現場的照片裡——紅色、白色和藍色。 如果你的 RAG 系統只有文字語料庫,它會努力搜尋、找到一些關於這艘船的文字描述,然後告訴你「藍色和金色的氣球」(海軍傳統顏色的語意聯想),或者直接說「文件中找不到相關資訊」。 如果你的系統有圖片語料庫,但架構是「把圖片和文字都放進同一個 Embedding 空間」呢?可能更糟——因為模態差距(Modality Gap),文字查詢會偏向文字結果,圖片的正確答案反而被壓制在排名後面。 這就是 KAIST 的 UniversalRAG(arXiv:2504.20734)試圖解決的問題。 同一個問題,三種架構給出不同結果 核心挑戰:模態差距的本質 # 左:統一 Embedding 方法偏向文字結果。右:UniversalRAG 路由器分配到正確模態空間(Modality Acc 95.28%) UniversalRAG 的最重要貢獻之一,是把「模態差距」這個現象做了精確的理論和實驗驗證。