多模態 Agent 長期記憶:文字摘要與視覺證據怎麼兼顧
多模態 Agent 要處理的不只是聊天紀錄,還可能包括圖片、螢幕畫面、影片片段、音訊與工具執行結果。當任務跨越多個工作階段時,系統必須決定哪些內容要留下、以什麼形式留下,以及之後遇到問題時要取回哪一份證據。這不是單純把內容「存進向量資料庫」就能解決的事。
把所有視覺內容改寫成文字摘要可以降低成本,但也可能刪掉物件位置、細微外觀、時間變化或畫面中的例外狀態;反過來,永久保留並反覆送入所有原始視覺 token,又會增加延遲與計算負擔。較實際的方向是讓文字、結構化資料與原始多模態證據各自負責適合的工作。
長期記憶真正要回答的三件事
- 保留什麼?是任務目標、已完成步驟、使用者偏好、物件狀態,還是畫面中的精確視覺細節?
- 如何索引?未來要靠日期、任務、實體、位置、工具執行紀錄、文字意義還是視覺相似性找到它?
- 何時取回原始證據?若問題只問「上次決定了什麼」,文字摘要可能足夠;若問題問「紅色按鈕在畫面的哪個位置」,就需要回到原始影像或保留的視覺表示。
這三個問題要隨任務風險與使用情境調整。客服摘要、工作流程代理、長影片理解與具身環境探索,所需的記憶粒度並不相同。
為什麼文字化記憶常會遺失關鍵資訊
文字摘要擅長保存目的、主題與明確事件,例如「使用者偏好深色模式」或「第 3 步已成功匯出檔案」。但摘要者必須先決定什麼重要;它沒有記下的物件位置、相對大小、細小標示、顏色差異或狀態變化,之後往往無法可靠地還原。
這不是文字摘要必然錯誤,而是資料表示的取捨。2026 年的 MemLens 與 MemEye 研究都以需要真正視覺證據的測試來檢查長期多模態記憶;它們發現,隨著內容累積,壓縮後的記憶在保留細緻視覺資訊與追蹤畫面狀態變化上仍有明顯困難。這些結果屬於特定基準上的研究證據,不代表所有模型或產品都會以相同方式失敗;但它提醒設計者不能只以「回答看起來合理」判斷記憶是否足夠。
視覺 token 壓縮也不是免費的捷徑
保留更多影像 token 或較高解析度的特徵,通常能留住更多細節,但會占用上下文、快取、儲存與檢索預算。研究界持續探索不同層級的壓縮與選擇性保留,正說明「保留全部」和「丟掉大部分」之間仍有工程取捨。
因此,好的問題不是「要不要壓縮」,而是:這項任務需要哪些細節、可以接受哪些遺失、以及遺失後能否回到原始證據驗證?若系統必須做安全、金錢、醫療、合規或不可逆的動作,只有摘要而沒有可追溯的來源通常不夠。
實務架構:讓不同記憶各司其職
核心原則:不要把摘要當成原始證據的替身。摘要與結構化索引負責快速搜尋;遇到需要視覺或時間細節的問題,再按需取回可授權存取的原始片段或高保真表示。
- 事件記憶:記錄任務、時間、參與實體、工具結果、成功或失敗狀態,以及原始媒體的不可變參照。
- 語意摘要:以短文字保存可重用的結論、使用者偏好與已驗證的規則,並連回來源事件。
- 結構化狀態:把日期、版本、位置、物件 ID、權限與狀態轉換等欄位存成可查詢資料,避免只靠自然語言猜測。
- 視覺或多模態證據:保留必要的影像、關鍵影格、區域特徵或其他高保真表示;設定保存期限、權限與刪除規則。
- 檢索與重排序:先依問題判斷它偏向文字、時間、結構化欄位還是視覺細節,再取回少量但最有關的證據;需要時讓模型重新查看原始來源。
例如,針對「上次使用者要求什麼格式」可先查語意摘要;針對「進度條在截圖中是否已完成」則應取回相對應的截圖或關鍵影格。WorldMM 等研究提出將文字與視覺記憶互補、依問題動態取用的做法,提供了值得測試的方向,而非一個可以不經驗證就照搬的通用配方。
時間、更新與衝突不能只靠覆寫
長期任務中的資訊會過期。若 Agent 看到「會議改到下午」,不應直接覆寫成沒有歷史的單一事實;較好的方式是保留來源、時間與有效狀態,讓檢索時優先使用最新且有效的版本,同時仍能追查變更原因。對同一物件的不同視覺狀態,也應以事件序列或版本關係保存,而不是只留最後一張摘要。
當來源互相矛盾或證據不足時,系統應能說明不確定性、要求重新取得資料,或拒絕做出超過證據的判斷。記憶系統的「不知道」能力,與記得多少一樣重要。
測試記憶品質,不能只看回答流暢
在上線前,建立一組需要不同證據粒度的問題,至少涵蓋:
- 文字摘要即可回答的跨工作階段問題;
- 必須看見畫面中細節、位置或特定物件的問題;
- 需要比較同一物件在不同時間點狀態的問題;
- 新資訊覆蓋舊資訊、但歷史仍須追溯的問題;
- 沒有足夠證據時,系統是否能正確拒答或要求補充資料。
除了正確率,也要量測取回證據數量、延遲、成本、來源可追溯性與任務成功率。更有力的測試方式是做消融比較:暫時移除原始影像、移除摘要或關閉時間篩選,觀察哪一類問題明顯退化。這能幫助團隊知道某段記憶真正提供了什麼價值。
常見問題
只存文字摘要,是否一定不夠?
不一定。若任務只需要高階事件與明確偏好,文字摘要可能很有效率;但問題一旦依賴視覺細節、空間關係或畫面演變,就應保留或可取回相應的視覺證據。
保留所有原始圖片或影片,就能解決記憶問題嗎?
不能。原始資料多不等於能被正確找到、理解與比較。仍需要事件索引、權限控制、時間關係、檢索策略與任務層級的評估。
視覺壓縮代表設計一定會失敗嗎?
不代表。壓縮是成本控制工具;關鍵是針對任務選擇保留粒度,對會影響決策的細節留下可追溯來源,並以真實問題驗證壓縮後是否仍能完成任務。
結語
多模態 Agent 的長期記憶不是把更多資料塞進更長的 context,而是讓每一種資料表示都有清楚責任。以文字與結構化記憶提高效率、以可授權的原始證據守住細節、以時間與來源管理更新,再用任務導向的測試檢驗結果,才能讓記憶真正支援長期推理。
參考資料
- MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models
- MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory
- M3-Agent: a multimodal agent with long-term memory
- WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning
- HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference















