<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>異質文件 on GuanLin's Latent Space</title><link>https://blog.my-techcore.com/tags/%E7%95%B0%E8%B3%AA%E6%96%87%E4%BB%B6/</link><description>Recent content in 異質文件 on GuanLin's Latent Space</description><generator>Hugo -- gohugo.io</generator><language>zh-TW</language><copyright>© 2026 GuanLin's Latent Space. All rights reserved.</copyright><lastBuildDate>Fri, 29 May 2026 20:00:00 +0800</lastBuildDate><atom:link href="https://blog.my-techcore.com/tags/%E7%95%B0%E8%B3%AA%E6%96%87%E4%BB%B6/index.xml" rel="self" type="application/rss+xml"/><item><title>Naive RAG 已死？Advanced RAG 不是換模型——四篇論文的架構思考</title><link>https://blog.my-techcore.com/posts/advanced-rag-new-standard-overview/</link><pubDate>Fri, 29 May 2026 20:00:00 +0800</pubDate><guid>https://blog.my-techcore.com/posts/advanced-rag-new-standard-overview/</guid><description>&lt;blockquote>&lt;p>這篇文章是四篇技術解析系列的入口，包含完整的論文對比框架與工程實踐建議。如果想把這些技術真正用在工作上，歡迎繼續讀下去，並點開各篇連結。&lt;/p>&lt;/blockquote>&lt;hr>

&lt;h2 class="relative group">一個讓人好奇的問題
 &lt;div id="一個讓人好奇的問題" class="anchor">&lt;/div>
 
 &lt;span
 class="absolute top-0 w-6 transition-opacity opacity-0 -start-6 not-prose group-hover:opacity-100 select-none">
 &lt;a class="text-primary-300 dark:text-neutral-700 !no-underline" href="#%e4%b8%80%e5%80%8b%e8%ae%93%e4%ba%ba%e5%a5%bd%e5%a5%87%e7%9a%84%e5%95%8f%e9%a1%8c" aria-label="">#&lt;/a>
 &lt;/span>
 
&lt;/h2>
&lt;p>有沒有想過，公司現在跑的 RAG 系統，在「真實文件」上的準確率是多少？&lt;/p>
&lt;p>指的不是乾淨的 Wikipedia 段落，也不是精心挑選的 benchmark，是企業實際業務文件：財務年報、法規手冊、技術規格書、會議記錄。這些文件通常同時包含大量文字敘述、多層次的表格、過時的數據，以及時間敏感的政策資訊。&lt;/p>
&lt;p>我最近閱讀了四篇 2025–2026 年發表的頂尖 RAG 論文，得到了一個有點驚訝的答案。&lt;/p>
&lt;p>&lt;strong>傳統 RAG 在真實異質文件上的 HiT@1，可以低到 1.59%。&lt;/strong>&lt;/p>
&lt;p>這不是劣質系統。這是企業通用的標準向量搜尋方法，套用在包含層級表格的真實文件上的表現。&lt;/p>
&lt;p>這四篇論文，從四個不同維度回答了「為什麼會這樣」，以及「我們應該怎麼做」：&lt;/p>
&lt;table>
 &lt;thead>
 &lt;tr>
 &lt;th>論文&lt;/th>
 &lt;th>核心問題&lt;/th>
 &lt;th>解法方向&lt;/th>
 &lt;/tr>
 &lt;/thead>
 &lt;tbody>
 &lt;tr>
 &lt;td>&lt;strong>TableRAG&lt;/strong>（Huawei Cloud, arXiv 2506.10380）&lt;/td>
 &lt;td>表格被拍扁後，跨列計算完全失準&lt;/td>
 &lt;td>讓資料庫直接計算，取代 LLM 語意猜測&lt;/td>
 &lt;/tr>
 &lt;tr>
 &lt;td>&lt;strong>MixRAG&lt;/strong>（BIT/Zhejiang, KDD 2026）&lt;/td>
 &lt;td>層級表格的行列語意在向量化時消失&lt;/td>
 &lt;td>H-RCL 層級表示法保留結構路徑&lt;/td>
 &lt;/tr>
 &lt;tr>
 &lt;td>&lt;strong>UniversalRAG&lt;/strong>（KAIST, arXiv 2504.20734）&lt;/td>
 &lt;td>不同模態強迫共享 Embedding 空間導致偏差&lt;/td>
 &lt;td>模態感知路由 + 粒度動態選擇&lt;/td>
 &lt;/tr>
 &lt;tr>
 &lt;td>&lt;strong>MRAG&lt;/strong>（NTU/NYU, arXiv 2412.15540）&lt;/td>
 &lt;td>日期匹配不等於時間推理，現有系統幾乎不懂&lt;/td>
 &lt;td>語意分數 × 時序計分規則的混合排名&lt;/td>
 &lt;/tr>
 &lt;/tbody>
&lt;/table>
&lt;p>這篇文章是這四篇RAG系列的入口，主要是為了先建立一個全局視野：&lt;strong>Advanced RAG 到底在解決什麼問題，這四篇論文各自站在哪個位置，它們合在一起說了什麼。&lt;/strong>&lt;/p></description></item></channel></rss>