多模態 RAG 的關鍵技術
構建一個成熟的多模態 RAG 系統,需要了解一些無縫處理圖像、文本和結構化數據的關鍵技術,包含 CLIP(對比語言 - 圖像預訓練)、多模態提示和工具調用等。
1.CLIP 嵌入
CLIP 的全稱是 Contrastive Language–Image Pretraining,是 OpenAI 開發的一種模型,爲文本和圖像創建了一個共享的表示空間。
核心方法是通過對比學習(Contrastive Learning)來預訓練模型,使其能夠理解圖像和文本之間的語義關係。這些嵌入能夠彌合圖像和文本之間的差距,從而實現有效的跨模態理解,使得 CLIP 成爲檢索增強生成(RAG)等多模態系統的關鍵組件。
2. 多模態提示
除了標準的基於文本的提示外,多模態提示使 RAG 系統能夠處理和推理包含文本、圖像等內容的輸入。
多模態提示可以讓用戶提供跨模態的輸入:
-
圖像:提供視覺背景或針對視覺內容提出問題。
-
表格:提供結構化數據以便進行推理。
-
音頻或視頻:基於視聽輸入,支持動態且具有上下文意識的查詢。
- 工具調用
工具調用是指 LLM 能夠調用外部工具或 API 來執行超出其內置功能的特定任務,比如 OCR 工具、表格處理器、瀏覽器檢索最新知識等。
工具調用使得 LLM 更像是一個協調員,將無法內部處理的任務委託給專門的工具,處理不同類型的數據、獲取實時數據或執行專門的計算。典型技術方案比如 Function calling、MCP 協議等。
然後就可以構建多模態 RAG 基本流程:
-
構造圖片 - 文本對的數據集。
-
使用 CLIP 爲數據對生成嵌入向量。
-
將這些嵌入向量存在向量數據庫中,方便後續檢索。
-
設計一個多模態查詢的檢索方案。
-
結合檢索結果,使用 LLM 來生成連貫且相關的響應。
本文由 Readfog 進行 AMP 轉碼,版權歸原作者所有。
來源:https://mp.weixin.qq.com/s/Ft24OiJhhBL0xXYXHz56_Q