多模態 RAG 的關鍵技術

構建一個成熟的多模態 RAG 系統,需要了解一些無縫處理圖像、文本和結構化數據的關鍵技術,包含 CLIP(對比語言 - 圖像預訓練)、多模態提示和工具調用等。

1.CLIP 嵌入

CLIP 的全稱是 Contrastive Language–Image Pretraining,是 OpenAI 開發的一種模型,爲文本和圖像創建了一個共享的表示空間。

核心方法是通過對比學習(Contrastive Learning)來預訓練模型,使其能夠理解圖像和文本之間的語義關係。這些嵌入能夠彌合圖像和文本之間的差距,從而實現有效的跨模態理解,使得 CLIP 成爲檢索增強生成(RAG)等多模態系統的關鍵組件。

2. 多模態提示

除了標準的基於文本的提示外,多模態提示使 RAG 系統能夠處理和推理包含文本、圖像等內容的輸入。

多模態提示可以讓用戶提供跨模態的輸入:

  1. 工具調用

工具調用是指 LLM 能夠調用外部工具或 API 來執行超出其內置功能的特定任務,比如 OCR 工具、表格處理器、瀏覽器檢索最新知識等。

工具調用使得 LLM 更像是一個協調員,將無法內部處理的任務委託給專門的工具,處理不同類型的數據、獲取實時數據或執行專門的計算。典型技術方案比如 Function calling、MCP 協議等。

然後就可以構建多模態 RAG 基本流程:

  1. 構造圖片 - 文本對的數據集。

  2. 使用 CLIP 爲數據對生成嵌入向量。

  3. 將這些嵌入向量存在向量數據庫中,方便後續檢索。

  4. 設計一個多模態查詢的檢索方案。

  5. 結合檢索結果,使用 LLM 來生成連貫且相關的響應。

本文由 Readfog 進行 AMP 轉碼,版權歸原作者所有。
來源https://mp.weixin.qq.com/s/Ft24OiJhhBL0xXYXHz56_Q