據(jù)到理解世界:大模型距離AGI還有多遠(yuǎn)的技術(shù)拆解)
這次我們來看一個比“新模型上線”更值得討論的命題DeepMind 創(chuàng)始人 Demis Hassabis 在公開場合多次提出AI 正在從“記住數(shù)據(jù)”走向“理解世界”。這句話在國內(nèi) AI 社區(qū)和 CSDN 的討論熱度一直很高因為它不只是一條新聞更是一個技術(shù)路線判斷大模型是不是真的產(chǎn)生了對世界的內(nèi)部表征我們離 AGI 究竟還有多少關(guān)鍵環(huán)節(jié)沒有打通這篇文章不打算做逐字訪談轉(zhuǎn)寫而是把“AI 開始理解世界”這個判斷拆成可討論的技術(shù)問題當(dāng)前大模型具備哪些能力和 AGI 還差在哪里哪些能力已經(jīng)有可驗證的評測方法哪些仍然屬于研究假設(shè)。內(nèi)容會保持工程視角盡量把虛的討論變成可以落地的評估思路和觀察清單。如果你平時做 AI 應(yīng)用開發(fā)、模型部署、AI Agent 相關(guān)工作或者只是關(guān)心大模型和 AGI 進(jìn)展這篇文章可以直接收藏。1. AGI 議題速覽先把討論范圍列成一張表方便讀者判斷這篇文章是否值得繼續(xù)讀。議題說明討論對象“AI 開始理解世界”這一判斷背后的技術(shù)依據(jù)以及 AGI 距離的公開分歧技術(shù)關(guān)注點(diǎn)大模型推理能力、世界模型、多模態(tài)對齊、AI Agent 長程任務(wù)、評測體系涉及模型類型大語言模型、多模態(tài)大模型、強(qiáng)化學(xué)習(xí)智能體、AI 編程與圖像視頻生成模型當(dāng)前可觀察現(xiàn)象模型能完成復(fù)雜推理、跨任務(wù)遷移、多模態(tài)理解和 Agent 工具調(diào)用主要瓶頸訓(xùn)練數(shù)據(jù)墻、算力與能耗、評測體系不完善、模型可解釋性不足可落地驗證方法基準(zhǔn)測試、能力涌現(xiàn)評測、隱空間表征分析、長程任務(wù)日志回放適合讀者算法工程師、AI 應(yīng)用開發(fā)者、技術(shù)決策者、關(guān)注 AGI 進(jìn)展的從業(yè)者需要先說明一個邊界本文不涉及具體未被確認(rèn)的內(nèi)部信息只使用公開訪談、公開論文和通用技術(shù)經(jīng)驗。很多結(jié)論屬于行業(yè)共識或研究推測在正文中會用“從公開討論看”“按當(dāng)前技術(shù)趨勢判斷”這類表達(dá)區(qū)分事實與判斷。2. “理解世界”在技術(shù)層面到底指什么Hassabis 所說的“理解世界”在深度學(xué)習(xí)領(lǐng)域有一個對應(yīng)的技術(shù)問題模型在訓(xùn)練完成后內(nèi)部是否形成了對數(shù)據(jù)背后客觀規(guī)律的表征而不只是記住了輸入輸出的統(tǒng)計關(guān)聯(lián)。大語言模型的原理本身是“下一個 token 預(yù)測”本質(zhì)上是在海量文本上學(xué)習(xí)條件概率。但近幾年的研究發(fā)現(xiàn)模型雖然以統(tǒng)計方式訓(xùn)練內(nèi)部卻會出現(xiàn)一些類似“線性表征”的結(jié)構(gòu)。例如模型可以學(xué)會把詞義映射到隱空間中的方向向量某些方向?qū)?yīng)性別、時態(tài)、情感等概念。更進(jìn)一步的實驗表明模型在處理空間關(guān)系、物理常識、游戲環(huán)境時能夠在隱空間建立與真實環(huán)境較為一致的坐標(biāo)映射。這就是“理解世界”這一說法的重要技術(shù)基礎(chǔ)模型內(nèi)部可能不是為了死記硬背而是為了更高效地建模數(shù)據(jù)生成過程才發(fā)展出了世界模型式的表征。這也是為什么 2024 年以來很多實驗室開始關(guān)注“模型隱藏表征”的研究而不是只看最終任務(wù)得分。如果你在一個分類任務(wù)里只觀察到模型輸出正確你無法判斷它是記住了訓(xùn)練樣本還是學(xué)到了規(guī)律但如果你能進(jìn)入模型的隱空間觀察它對不同測試樣本的內(nèi)部激活模式就能更接近真相。從這個角度看“AI 開始理解世界”和“AI 具備意識”是兩回事。前者是可檢驗的內(nèi)部表征問題后者涉及主觀體驗?zāi)壳斑€沒有可靠的技術(shù)實驗方法。我們在討論 AGI 時應(yīng)該先把這兩件事分開。3. 當(dāng)前大模型離 AGI 還有多遠(yuǎn)從能力維度看3.1 語言與邏輯推理大語言模型在語言任務(wù)上已經(jīng)非常接近人類水平。法律文本改寫、代碼生成、技術(shù)文檔寫作、數(shù)學(xué)競賽題解答這些能力在真實工作中已經(jīng)具備實用價值。AI 編程工具甚至已經(jīng)成為許多工程師的標(biāo)準(zhǔn)工作流AI 智能體也開始承擔(dān)自動寫代碼、自動跑測試、自動提 PR 的任務(wù)。但語言能力接近人類不等于推理能力接近人類。模型在復(fù)雜多步推理、反事實推理、需要嚴(yán)格因果邏輯的任務(wù)上仍然會出現(xiàn)系統(tǒng)性錯誤。尤其在信息不完整、需要主動澄清條件、需要區(qū)分相關(guān)性與因果性的場景下模型很難穩(wěn)定保持正確。推理能力的差距是 AGI 距離討論中最難量化、也最影響實際應(yīng)用的部分。3.2 規(guī)劃與長程任務(wù)執(zhí)行AGI 非常重要的一環(huán)是規(guī)劃能力面對一個需要多步驟執(zhí)行、跨長時段、可能遇到環(huán)境反饋的任務(wù)模型能否自己把目標(biāo)拆解成子任務(wù)并根據(jù)中途反饋調(diào)整計劃。當(dāng)前基于大模型的 Agent 已經(jīng)能完成簡單的多步任務(wù)例如讓 AI Agent 訪問網(wǎng)頁、調(diào)用搜索、讀取文檔、生成回復(fù)。但在任務(wù)步數(shù)超過幾十步、環(huán)境反饋稀疏、子任務(wù)之間需要嚴(yán)格依賴時錯誤會累積模型通常缺少“我走到哪一步了、哪些步驟已經(jīng)失效、是否需要回退”的自我監(jiān)控能力。長程任務(wù)能力是當(dāng)前從“大模型”走向“AGI”最明顯的短板之一。很多團(tuán)隊發(fā)現(xiàn)推理能力很強(qiáng)的模型放到真實 Agent 工作流里表現(xiàn)并不穩(wěn)定核心原因正是規(guī)劃與錯誤恢復(fù)不足。3.3 多模態(tài)感知與世界感知多模態(tài) AGI 是最近討論非常密集的方向。現(xiàn)在的模型已經(jīng)能同時處理文本、圖像、音頻、視頻用戶可以直接上傳一張截圖讓模型分析 UI 結(jié)構(gòu)上傳一段語音讓模型轉(zhuǎn)寫并總結(jié)。多模態(tài)對齊技術(shù)讓模型在不同信息形式之間建立統(tǒng)一語義空間這是“理解世界”的一個重要基礎(chǔ)。但需要區(qū)分的是多模態(tài)輸入不等于物理世界感知。模型能識別圖片里的杯子不等于它理解杯子在真實物理環(huán)境中的重量、材質(zhì)、運(yùn)動狀態(tài)。業(yè)界對此有過不少實驗?zāi)P蛯o態(tài)圖片描述表現(xiàn)很好但在涉及物體數(shù)量、空間位置、連續(xù)動態(tài)變化的測試中會出現(xiàn)明顯錯誤。所以更穩(wěn)妥的判斷是模型建立了“跨越模態(tài)的符號理解”但還缺少“與真實物理世界持續(xù)交互”的能力。3.4 自主目標(biāo)與數(shù)據(jù)獲取最后是數(shù)據(jù)和目標(biāo)的問題。人類學(xué)習(xí)依靠與真實世界持續(xù)互動可以用低樣本快速學(xué)會新技能當(dāng)前大模型主要靠靜態(tài)數(shù)據(jù)訓(xùn)練無法在訓(xùn)練完成后主動向環(huán)境提問、設(shè)計實驗、收集新數(shù)據(jù)來彌補(bǔ)知識盲區(qū)。即使加入強(qiáng)化學(xué)習(xí)模型的學(xué)習(xí)范圍也限制在獎勵函數(shù)設(shè)計的框架內(nèi)。比如下棋 AI 可以在明確規(guī)則的空間里超越人類但在開放、模糊、需要自己定義目標(biāo)的真實任務(wù)中模型并沒有表現(xiàn)出很強(qiáng)的自主性。數(shù)據(jù)獲取能力不足會直接限制模型向 AGI 靠近的速度。4. 驗證一個模型是否具備“世界理解”的評估方法與其爭論“AI 是否理解世界”不如直接設(shè)計一套可操作的驗證流程。下面是適合開發(fā)者和算法工程師落地的評估思路。4.1 任務(wù)設(shè)計思路評估“世界理解”不能只看單一任務(wù)的準(zhǔn)確率至少應(yīng)該覆蓋四個維度泛化測試模型在一個分布下訓(xùn)練在另一個分布下測試觀察是否真的學(xué)到規(guī)律。反事實測試修改任務(wù)條件為不會出現(xiàn)在訓(xùn)練集中的情況看模型能否正確推斷。長程穩(wěn)定性讓模型執(zhí)行多步任務(wù)觀察錯誤率是否隨步數(shù)增長。表征分析提取模型內(nèi)部激活判斷是否存在與任務(wù)結(jié)構(gòu)一致的線性表征。以一個二維房間導(dǎo)航任務(wù)為例可以這樣設(shè)計先讓模型閱讀房間描述再問它“從 A 點(diǎn)走到 B 點(diǎn)會不會經(jīng)過 C 區(qū)域”。如果模型只背過訓(xùn)練語料它會在新房間布局上表現(xiàn)明顯下降如果模型學(xué)到空間結(jié)構(gòu)則能泛化到從未見過的房間數(shù)據(jù)。4.2 最小評估流程的代碼示例下面給出一段 Python 偽代碼用于搭建一個最小評估流程。實際使用時需要替換成目標(biāo)模型的 API 或本地部署接口。# 最小能力評估示例泛化與反事實測試 import json tasks [ { type: in_distribution, context: 房間 A、B、C 按一字排列A 在最左C 在最右。, question: 從 A 走到 C會經(jīng)過 B 嗎, answer: 會 }, { type: counterfactual, context: 房間 A、B、C 按環(huán)形排列A 與 C 直接相鄰。, question: 從 A 走到 C最短路徑必須經(jīng)過 B 嗎, answer: 不必 } ] def evaluate_model(model_predict): results [] for task in tasks: response model_predict(task[context], task[question]) results.append({ type: task[type], correct: response.strip() task[answer], response: response.strip() }) return results # 使用方式將 model_predict 替換為真實模型調(diào)用函數(shù) # results evaluate_model(my_model_predict)這段代碼的核心思想是把“理解”測試拆成分布內(nèi)、反事實、長程三類樣本按類別統(tǒng)計準(zhǔn)確率而不是給一個籠統(tǒng)的分?jǐn)?shù)。如果反事實樣本準(zhǔn)確率明顯低于分布內(nèi)樣本說明模型更多依賴統(tǒng)計捷徑而非穩(wěn)定規(guī)則。4.3 隱空間表征的可視化分析如果需要更接近研究層面的驗證可以分析模型內(nèi)部激活。常見方法是用 PCA 或探針分類器檢查模型隱向量中是否包含任務(wù)相關(guān)信息。# 提取模型隱向量并做線性探針分析示意 import numpy as np from sklearn.decomposition import PCA from sklearn.linear_model import LogisticRegression # hidden_states: 列表每個元素是模型對一條樣本的隱層輸出 # labels: 對應(yīng)該樣本的目標(biāo)標(biāo)簽 hidden_matrix np.array(hidden_states) pca PCA(n_components2) projected pca.fit_transform(hidden_matrix) probe LogisticRegression() probe.fit(projected, labels) print(Probe Accuracy:, probe.score(projected, labels))如果探針準(zhǔn)確率較高說明模型隱空間里已經(jīng)包含可分離的任務(wù)信息如果探針準(zhǔn)確率低但任務(wù)輸出正確說明模型可能用了其他路徑解決任務(wù)這種情況同樣值得關(guān)注。4.4 長程 Agent 任務(wù)的日志設(shè)計對 AI Agent 類系統(tǒng)建議在評估時記錄完整軌跡回放數(shù)據(jù)。{ task_id: task_001, task: 在測試環(huán)境部署服務(wù)并返回健康檢查地址, steps: [ {step: 1, action: read_docs, duration_ms: 200}, {step: 2, action: run_command, output: pytest passed}, {step: 3, action: deploy_service, output: http://127.0.0.1:8080/health} ], error_recovery: 1, final_status: success }通過日志可以清楚看到模型在哪里出錯、在哪里恢復(fù)、哪類任務(wù)需要人工干預(yù)。這樣可以把“Agent 是否智能”的抽象問題轉(zhuǎn)成具體的工程指標(biāo)。5. 算力與工程約束AGI 不只是算法問題即使算法路徑正確AGI 的實現(xiàn)還面臨非常現(xiàn)實的算力和數(shù)據(jù)約束。大模型的訓(xùn)練需要大規(guī)模 GPU 集群訓(xùn)練一次前沿模型需要數(shù)萬個加速卡級別的計算資源推理側(cè)的成本同樣不低支持長上下文、高并發(fā)、多模態(tài)推理的在線服務(wù)需要持續(xù)投入硬件。對絕大多數(shù)團(tuán)隊來說真正的問題不是“模型能不能做到”而是“在成本可控的前提下能不能穩(wěn)定做到”。數(shù)據(jù)也是關(guān)鍵瓶頸。高質(zhì)量公開文本數(shù)據(jù)正接近耗盡業(yè)界開始用合成數(shù)據(jù)、多模態(tài)數(shù)據(jù)和用戶反饋數(shù)據(jù)來補(bǔ)充。但合成數(shù)據(jù)可能導(dǎo)致模型偏差累積多模態(tài)數(shù)據(jù)來自真實世界采集又涉及隱私和版權(quán)。2024 年以來很多模型廠商的主要投入都集中在數(shù)據(jù)治理和版權(quán)合規(guī)上這說明數(shù)據(jù)問題已經(jīng)從研究問題變成了商業(yè)問題。工程側(cè)還需要關(guān)注模型部署的高可用性分布式推理、容錯調(diào)度、顯存優(yōu)化、批量任務(wù)隊列、API 負(fù)載均衡。除非模型能直接在個人單卡上實時運(yùn)行否則任何 AGI 能力都依賴底層系統(tǒng)工程。這也是為什么“AI 模型部署”“AI 工程實踐”成為當(dāng)前行業(yè)熱門崗位方向。6. 不同觀點(diǎn)的分歧為什么有人說幾年有人說幾十年關(guān)于 AGI 距離的公開判斷存在很大分歧這些分歧本質(zhì)上來自對不同能力的權(quán)重不同。樂觀派認(rèn)為當(dāng)前模型已經(jīng)在語言、圖像、代碼、推理等多個維度接近人類基線只要繼續(xù)擴(kuò)大模型規(guī)模、增加交互數(shù)據(jù)和強(qiáng)化學(xué)習(xí)AGI 可能在數(shù)年內(nèi)出現(xiàn)。Hassabis 在多個公開訪談中給過“可能在一個十年內(nèi)”這一量級的估計DeepMind 團(tuán)隊的工作也一直在推進(jìn)世界模型、多智能體、規(guī)劃能力等方向。中間派認(rèn)為當(dāng)前模型只是“非常優(yōu)秀的聯(lián)想引擎”在真實世界持續(xù)交互、自主目標(biāo)設(shè)定、長期記憶、低樣本適應(yīng)等方面仍遠(yuǎn)未達(dá)到通用智能標(biāo)準(zhǔn)。即使某些單項能力超過人類也不代表整體系統(tǒng)具備通用性。他們傾向認(rèn)為 AGI 需要新的架構(gòu)突破而不是現(xiàn)有范式的簡單放大。懷疑派則認(rèn)為大語言模型本質(zhì)上是在擬合文本分布無法產(chǎn)生真正的世界理解如果不變更底層建模方式AGI 可能幾十年內(nèi)都無法實現(xiàn)。這種分歧不是誰對誰錯的問題而是對“什么才算 AGI”的定義不同。工程團(tuán)隊更應(yīng)該關(guān)注的是可測量的能力項而不是時間點(diǎn)預(yù)測。7. 開發(fā)者應(yīng)該怎么跟進(jìn) AGI 進(jìn)展對普通開發(fā)者和技術(shù)團(tuán)隊而言與其爭論 AGI 何時到來不如建立一套可長期使用的跟進(jìn)機(jī)制。第一持續(xù)跟蹤權(quán)威評測基準(zhǔn)。語言推理、多模態(tài)理解、Agent 任務(wù)、編程能力等方向都有公開榜單。不要只看模型宣傳稿里的演示要關(guān)注模型在第三方基準(zhǔn)上的表現(xiàn)尤其是長文本、多步推理、抗幻覺類任務(wù)。第二建立自己的業(yè)務(wù)能力基線。選擇幾個和業(yè)務(wù)最相關(guān)的任務(wù)用固定測試集長期評測模型版本變化。模型升級時先跑回歸測試再決定是否切換避免個別能力上升但整體穩(wěn)定性下降。第三把 AI Agent 當(dāng)成主線方向。AGI 的落地形態(tài)大概率不是“一個超大模型”而是多個模型 工具調(diào)用 工作流編排的組合系統(tǒng)。多關(guān)注 AI 智能體框架、工具調(diào)用協(xié)議、任務(wù)規(guī)劃與錯誤恢復(fù)機(jī)制這些能力在未來比模型參數(shù)量更重要。第四關(guān)注 AI 應(yīng)用開發(fā)的合規(guī)邊界。生成模型可能復(fù)現(xiàn)版權(quán)內(nèi)容、歪曲事實或泄露隱私。在真實項目中使用 AI 生成內(nèi)容必須建立人工審核機(jī)制尤其是面向公開用戶的文字、圖像、音視頻內(nèi)容。8. 常見誤區(qū)與認(rèn)知偏差下面列出討論 AGI 時最容易出現(xiàn)的誤區(qū)建議收藏備用。誤區(qū)更接近事實的判斷模型考試分?jǐn)?shù)高 已經(jīng)理解世界分?jǐn)?shù)高只能說明完成任務(wù)表現(xiàn)好內(nèi)部機(jī)制是否造成真實理解需要額外實驗驗證模型會答反事實問題 具備邏輯推理部分模型可能通過訓(xùn)練語料中的相似表述繞過真實推理模型輸出自然 有意識語言流暢度和主觀意識沒有已知的必然聯(lián)系A(chǔ)GI 是單一時間點(diǎn)事件AGI 更可能是能力逐步補(bǔ)齊的過程不同能力會有不同落地時間算力無限增加就能實現(xiàn) AGI數(shù)據(jù)、算法、評測、工程共同決定上限算力只是其中一環(huán)只要本地部署大模型就是安全可控模型內(nèi)部仍然可能產(chǎn)生不穩(wěn)定輸出需要評測和審核兜底9. 合規(guī)與使用邊界提醒討論 AGI 的能力時也需要同步討論使用邊界。無論模型能力多強(qiáng)在真實系統(tǒng)中使用 AI 都必須考慮以下問題訓(xùn)練和輸入數(shù)據(jù)是否獲得合法授權(quán)是否包含個人隱私或商業(yè)機(jī)密。生成內(nèi)容是否可能造成誤導(dǎo)例如偽造事實、生成虛假圖片或音視頻。面向用戶輸出時是否加入標(biāo)識讓用戶知道內(nèi)容來自 AI。模型是否會被用于自動化騷擾、深度偽造、繞過安全機(jī)制等惡意用途。在發(fā)布或商用前是否完成效果復(fù)核和風(fēng)險測試。這些邊界不是“限制創(chuàng)新”而是讓技術(shù)可以持續(xù)被信任的前提。AGI 如果真要進(jìn)入真實社會除了算法突破還必須配套完善的負(fù)責(zé)任使用框架。10. 總結(jié)與后續(xù)觀察點(diǎn)回到最初的問題DeepMind 創(chuàng)始人說“AI 開始理解世界”這個判斷是否成立從現(xiàn)有論文和實驗結(jié)果看模型內(nèi)部確實出現(xiàn)了和真實世界結(jié)構(gòu)對應(yīng)對齊的表征這比早期純粹統(tǒng)計學(xué)習(xí)的判斷更有說服力。但距離 AGI仍然隔著長程規(guī)劃、實時交互、自主數(shù)據(jù)獲取和穩(wěn)定評測這幾道硬門檻。最值得驗證的能力不是模型寫詩或畫圖的能力而是它在長程任務(wù)中能否穩(wěn)定規(guī)劃、自我糾錯并遷移到新環(huán)境。最容易踩的坑則是把基準(zhǔn)分?jǐn)?shù)當(dāng)成智能水平忽略模型在開放場景中的失效模式。建議有條件的技術(shù)團(tuán)隊搭建自己的小規(guī)模評測集持續(xù)跟蹤模型演進(jìn)而不是被階段性演示沖昏頭腦。下一步可以重點(diǎn)觀察幾個方向多模態(tài)模型的物理常識能力是否提升、AI Agent 長程任務(wù)成功率是否改善、推理模型是否會全面取代普通模型成為主流默認(rèn)選項以及世界模型是否從研究走向?qū)嶋H產(chǎn)品。這些點(diǎn)每有一個突破AGI 距離就會被真實地拉近一步。