與實(shí)時(shí)交互:語(yǔ)音 Agent 與 Computer Use 的架構(gòu)分析)
多模態(tài)與實(shí)時(shí)交互語(yǔ)音 Agent 與 Computer Use 的架構(gòu)分析前幾章構(gòu)建的 Agent 與世界的交互是輪流的用戶說(shuō)完一句Agent 想一段、調(diào)用幾個(gè)工具再回一句在它思考的這段時(shí)間里世界被默認(rèn)為靜止的。這個(gè)前提如此自然以至于很少被當(dāng)成一個(gè)假設(shè)寫出來(lái)。然而真實(shí)環(huán)境不會(huì)等模型作出反應(yīng)郵件在思考時(shí)到達(dá)用戶在說(shuō)話途中插話頁(yè)面在兩次截圖之間已經(jīng)變了樣。本文圍繞模態(tài)和觸發(fā)時(shí)機(jī)兩個(gè)維度對(duì) Agent 交互架構(gòu)的擴(kuò)展進(jìn)行技術(shù)分析涵蓋異步事件驅(qū)動(dòng)、語(yǔ)音交互范式、Computer Use 以及機(jī)器人操作。兩個(gè)擴(kuò)展維度把觀察空間和動(dòng)作空間攤開會(huì)發(fā)現(xiàn)它們各有兩個(gè)可以擴(kuò)展的方向模態(tài)決定觀察和動(dòng)作的形式Agent 是只讀文本還是也能聽見聲音、看見屏幕、感知力矩是只能輸出 token還是也能發(fā)聲、點(diǎn)擊、驅(qū)動(dòng)關(guān)節(jié)。觸發(fā)時(shí)機(jī)決定觀察和動(dòng)作的節(jié)奏觀察是 Agent 主動(dòng)去取還是世界主動(dòng)推來(lái)動(dòng)作是必須在一個(gè)回合內(nèi)做完還是可以跨越回合、中途被打斷、被更緊急的事?lián)屨?。尺度?chǎng)景觀察側(cè)的變化動(dòng)作側(cè)的變化秒-天異步與事件驅(qū)動(dòng)會(huì)被外部事件主動(dòng)喚醒的 Agent動(dòng)作跨回合先發(fā)起后續(xù)靠事件收尾10 毫秒-1 秒語(yǔ)音邊說(shuō)邊聽不等一句說(shuō)完邊想邊說(shuō)可被打斷亞秒-秒Computer Use屏幕在兩幀之間持續(xù)變化動(dòng)作后必須重新確認(rèn)現(xiàn)實(shí)是否仍符合計(jì)劃毫秒機(jī)器人傳感器連續(xù)回流動(dòng)作分塊一次規(guī)劃一小段可被搶占異步與事件驅(qū)動(dòng)當(dāng)世界主動(dòng)找上門核心矛盾訓(xùn)練同步部署異步LLM 的訓(xùn)練范式假設(shè)同步——發(fā)出工具調(diào)用后下一條消息必須是工具結(jié)果。而真實(shí)部署要求異步——用戶隨時(shí)可能打斷多個(gè)任務(wù)可能并發(fā)推進(jìn)外部事件可能在工具尚未返回時(shí)就抵達(dá)。這一訓(xùn)練同步/部署異步的矛盾貫穿了異步 Agent 架構(gòu)的所有工程取舍。事件驅(qū)動(dòng)的異步 Agent 架構(gòu)不再主動(dòng)反復(fù)檢查有沒有新消息輪詢效率低而是在新消息到達(dá)時(shí)自動(dòng)觸發(fā)處理邏輯。所有的輸入、輸出、思考過程和外部交互都被統(tǒng)一建模為事件流?;诰o急度的三種處理策略一個(gè) Agent 實(shí)例可能同時(shí)面對(duì)多個(gè)事件用戶的新消息、工具返回的結(jié)果、定時(shí)器到期、另一個(gè) Agent 的協(xié)作請(qǐng)求。三種處理策略的區(qū)別在于對(duì)待安全點(diǎn)的方式取消式處理用于緊急事件主動(dòng)中斷當(dāng)前步驟把這一刻變成可以消費(fèi)新事件的邊界。系統(tǒng)停止當(dāng)前操作清空待處理隊(duì)列將所有事件一次性追加到軌跡末尾立即重新調(diào)用 LLM。這對(duì)應(yīng)于用戶在 Agent 執(zhí)行可能錯(cuò)誤的操作時(shí)輸入停我說(shuō)錯(cuò)了的場(chǎng)景。隊(duì)列式處理用于常規(guī)事件不打斷當(dāng)前操作等待當(dāng)前操作完成后將所有事件一次性追加。例如 Agent 調(diào)用搜索工具后用戶補(bǔ)充只看最近一個(gè)月的結(jié)果搜索結(jié)果返回時(shí)兩個(gè)事件一起呈現(xiàn)給 LLM避免不必要的往返。并行處理用于獨(dú)立的輕量級(jí)查詢?nèi)缃裉焯鞖庠趺礃?。既不打斷主任?wù)也不讓用戶等太久在并行推理會(huì)話中獨(dú)立執(zhí)行。工程權(quán)宜模擬同步的異步實(shí)現(xiàn)核心思想是在沒有打斷發(fā)生的常態(tài)下讓 LLM 看到標(biāo)準(zhǔn)的同步軌跡只在打斷時(shí)才插入占位符來(lái)修復(fù)格式。有五條關(guān)鍵規(guī)則LLM 輸出后立即記錄 assistant message工具調(diào)用完成時(shí)才記錄 tool result工具執(zhí)行中的打斷需要占位符LLM 思考中的打斷直接丟棄當(dāng)前思考非打斷事件進(jìn)入隊(duì)列等待批處理。這套方案的核心優(yōu)勢(shì)是常態(tài)下 LLM 看到的是完美的同步軌跡最大程度保證了思考質(zhì)量。但仍存在加劇幻覺的風(fēng)險(xiǎn)盡管占位符明確說(shuō)明工具尚未完成系統(tǒng)仍可能在后續(xù)思考中編造一個(gè)工具結(jié)果基于虛構(gòu)的結(jié)果做出不恰當(dāng)?shù)臎Q策。語(yǔ)音從級(jí)聯(lián)到全雙工的范式演進(jìn)語(yǔ)音的價(jià)值不只是把文字換成聲音。正常說(shuō)話的速度約為打字的四倍而且不占用雙手與視線因此它天然適合把 Agent 放進(jìn)持續(xù)工作、隨時(shí)可能被打斷的輸入輸出回路。三種交互范式的主線是如何擺脫輪流說(shuō)話和 VAD語(yǔ)音活動(dòng)檢測(cè)對(duì)發(fā)言權(quán)的猜測(cè)。范式核心結(jié)構(gòu)主要優(yōu)勢(shì)主要限制級(jí)聯(lián)VAD - ASR - LLM - TTS模塊清晰、易替換、易調(diào)試延遲累積副語(yǔ)言信息在接口處丟失端到端 Omni原生音頻輸入輸出按輪次交互延遲較低能保留語(yǔ)氣、情緒和環(huán)境聲仍依賴輪次訓(xùn)練和調(diào)試成本較高全雙工原生音頻輸入輸出持續(xù)聽、說(shuō)和決策支持重疊說(shuō)話、自然打斷和連續(xù)流模型訓(xùn)練、控制和評(píng)估都更復(fù)雜級(jí)聯(lián)流水線及其優(yōu)化絕大多數(shù)商業(yè)語(yǔ)音助手基于串行流水線VAD 判斷用戶何時(shí)說(shuō)完ASR 把音頻轉(zhuǎn)成文字LLM 理解并生成回復(fù)TTS 再把文字念出來(lái)。模塊化讓每個(gè)組件可以獨(dú)立優(yōu)化但每一級(jí)都可能增加等待時(shí)間。級(jí)聯(lián)方案有三個(gè)問題延遲累積必須等待一段靜音才能確認(rèn)說(shuō)完、信息丟失有聲/無(wú)聲二值信號(hào)無(wú)法表達(dá)猶豫、情緒和環(huán)境聲、上下文被切斷專有名詞可能被分片識(shí)別而出錯(cuò)。流式感知是一種保留模塊化分工前提下的優(yōu)化方案ASR 邊聽邊轉(zhuǎn)LLM 推測(cè)執(zhí)行TTS 增量合成讓各階段盡早產(chǎn)出增量結(jié)果。全雙工交互模型Omni 仍然把對(duì)話分成用戶說(shuō)和模型說(shuō)兩個(gè)時(shí)段但同聲傳譯等任務(wù)要求兩者重疊進(jìn)行。全雙工模型不再預(yù)設(shè)輪次而是持續(xù)聽、持續(xù)說(shuō)并不斷決定繼續(xù)、停頓、打斷或調(diào)用工具。Thinking Machines Lab 將這類路線稱為交互模型交互性不再依靠 VAD 等外部 harness 拼裝實(shí)現(xiàn)而是內(nèi)建在模型中。OpenAI 的 GPT-Live 則把全雙工路線帶到生產(chǎn)規(guī)模??炻伎挤蛛x與端到端統(tǒng)一的取舍交互表現(xiàn)和智能上限是兩個(gè)維度前臺(tái)模型要在用戶仍然在線時(shí)回應(yīng)后臺(tái)模型可以花更多時(shí)間思考。三種方案是設(shè)計(jì)取舍快思考回應(yīng)慢思考回答、快思考交互慢思考提醒、端到端思考與表達(dá)統(tǒng)一??炻蛛x有一個(gè)重要的工程優(yōu)勢(shì)它能直接承接慢模型的迭代紅利。前臺(tái)快模型只負(fù)責(zé)低延遲地傾聽、應(yīng)答和維持對(duì)話后臺(tái)慢模型負(fù)責(zé)推理、規(guī)劃和工具調(diào)用更強(qiáng)的思考模型發(fā)布后只需替換后臺(tái)模型不必重新訓(xùn)練整套實(shí)時(shí)語(yǔ)音系統(tǒng)。統(tǒng)一路線則把推理與交互綁定在同一個(gè)訓(xùn)練周期中每次升級(jí)都要重新兼顧智能水平、響應(yīng)延遲和表達(dá)自然度。Computer UseGUI 自動(dòng)化 Agent語(yǔ)音把時(shí)機(jī)軸推到了毫秒級(jí)但它的觀察仍是一維的聲音流。Computer Use 把同一個(gè)問題搬上二維的屏幕觀察變成持續(xù)變化的像素動(dòng)作變成坐標(biāo)上的點(diǎn)擊與輸入。感知-思考-行動(dòng)循環(huán)Computer Use 的核心是一個(gè)感知-思考-行動(dòng)循環(huán)Agent 截取當(dāng)前屏幕畫面多模態(tài)模型接收截圖和任務(wù)指令輸出一個(gè)具體動(dòng)作執(zhí)行層在真實(shí)環(huán)境中執(zhí)行該動(dòng)作等待界面響應(yīng)后再次截圖進(jìn)入下一輪循環(huán)。這里要區(qū)分看懂界面和完成任務(wù)。前者更接近多模態(tài)理解能力可以用一次截圖問答來(lái)測(cè)量后者則要求模型把理解和生成動(dòng)作放進(jìn)閉環(huán)處理頁(yè)面加載、狀態(tài)變化、誤操作和不可逆后果。Computer Use 的難點(diǎn)不只是讓模型在截圖上答對(duì)而是讓它在每一步之后重新確認(rèn)現(xiàn)實(shí)是否仍符合計(jì)劃。動(dòng)作空間設(shè)計(jì)Anthropic 的參考實(shí)現(xiàn)把完整交互能力分成三類工具GUI 操作工具鼠標(biāo)移動(dòng)/點(diǎn)擊/拖拽、鍵盤輸入、截圖等、命令執(zhí)行工具持久 bash 終端會(huì)話、文件編輯工具基于字符串匹配的安全編輯。這是一個(gè)清晰的動(dòng)作空間設(shè)計(jì)但不是必須遵守的私有協(xié)議只要 Harness 能把同樣的截圖、動(dòng)作約束和執(zhí)行結(jié)果轉(zhuǎn)換成目標(biāo)模型支持的消息與結(jié)構(gòu)化輸出不同模型都可以驅(qū)動(dòng)同一個(gè)循環(huán)。視覺定位的三條路線在循環(huán)的每一輪中模型需要在截圖中準(zhǔn)確定位目標(biāo)元素。當(dāng)前主要有兩條思路把定位變成選擇題先把界面元素標(biāo)注好編號(hào)模型只需從中選一個(gè)。有兩種實(shí)現(xiàn)方式——純視覺標(biāo)注Set-of-Mark用分割模型在像素上切出候選區(qū)域和結(jié)構(gòu)化元素索引DOM/Accessibility Tree直接讀取界面自帶的結(jié)構(gòu)。后者的優(yōu)勢(shì)是把開放式的在截圖中找到按鈕并預(yù)測(cè)坐標(biāo)轉(zhuǎn)化為封閉式的從已標(biāo)注好的元素中選一個(gè)就像考試中選擇題比填空題更容易答對(duì)。純坐標(biāo)預(yù)測(cè)不做任何標(biāo)注直接讓模型輸出坐標(biāo)。以 SeeClick 和 Claude 的 computer use 為代表在海量 GUI 截圖和元素位置的配對(duì)數(shù)據(jù)上訓(xùn)練視覺模型讓它學(xué)會(huì)將自然語(yǔ)言描述直接映射到截圖中的精確坐標(biāo)。模型對(duì)坐標(biāo)的理解高度依賴訓(xùn)練時(shí)使用的分辨率因此需要在工具層實(shí)現(xiàn)雙向坐標(biāo)縮放機(jī)制。三條路線的選擇邏輯結(jié)構(gòu)化信息可得時(shí)優(yōu)先用 DOM/Accessibility Tree 索引定位最精確穩(wěn)定不可得時(shí)原生桌面軟件、Canvas/WebGL 渲染的界面、游戲可以用視覺標(biāo)注或坐標(biāo)預(yù)測(cè)。Computer Use 的世界模型傳統(tǒng) Computer Use 假設(shè)屏幕是靜止的——截一張圖、想一步、點(diǎn)一下再截下一張圖??涩F(xiàn)實(shí)里的屏幕會(huì)放視頻、會(huì)彈出轉(zhuǎn)瞬即逝的通知、會(huì)播放會(huì)議里的人聲。觀察接口AOI通過屏幕關(guān)鍵幀截圖、音量門控的語(yǔ)音轉(zhuǎn)寫和文字描述畫面等技術(shù)把連續(xù)的環(huán)境觀察轉(zhuǎn)換成模型便于處理的離散事件。更進(jìn)一步世界模型讓 Agent 能夠在行動(dòng)前預(yù)測(cè)桌面接下來(lái)可能變成什么從而實(shí)現(xiàn)類似于人類的推測(cè)執(zhí)行機(jī)制如果實(shí)際變化與預(yù)期一致就沿著原定計(jì)劃繼續(xù)執(zhí)行只有發(fā)現(xiàn)頁(yè)面狀態(tài)偏離預(yù)期才停下來(lái)重新觀察和規(guī)劃。2026 年 Induction Labs 公布的 Photon-1 展示了這條路線的一種實(shí)現(xiàn)把每幀壓縮為離散的潛在 token自回歸預(yù)測(cè)動(dòng)作之后的下一狀態(tài)表示。移動(dòng)端的生態(tài)壁壘Computer Use 在移動(dòng)端面臨的主要挑戰(zhàn)往往不是技術(shù)差異而是生態(tài)壁壘。傳統(tǒng)互聯(lián)網(wǎng)應(yīng)用的核心變現(xiàn)邏輯是流量與注意力用戶刷信息流時(shí)看到廣告瀏覽頁(yè)面時(shí)產(chǎn)生沖動(dòng)消費(fèi)。當(dāng) Agent 代替用戶操作時(shí)這條變現(xiàn)鏈路被徹底繞過AI 不會(huì)關(guān)注廣告也不會(huì)沖動(dòng)消費(fèi)直奔目標(biāo)完成任務(wù)就走。這意味著 Computer Use 面對(duì)的不僅是 CAPTCHA 等技術(shù)對(duì)抗更是一個(gè)結(jié)構(gòu)性的利益沖突。機(jī)器人操作從仿真到真機(jī)機(jī)器人操作比看圖回答問題難得多。模型不但要看懂畫面還要在真實(shí)世界里連續(xù)做出動(dòng)作而且每個(gè)動(dòng)作都會(huì)改變下一刻的情況。機(jī)器人系統(tǒng)通常把不同時(shí)間尺度的工作分開任務(wù)目標(biāo)分鐘級(jí)、長(zhǎng)程規(guī)劃秒到分鐘、基本技能約 1-3 秒、VLA/技能策略約 1-10 Hz 推理、底層控制與安全層約 50-1000 Hz。這種分工的關(guān)鍵是把任務(wù)順序和眼前動(dòng)作分開否則高層模型的推理延遲會(huì)拖慢底層控制。VLAVision-Language-Action模型接收當(dāng)前畫面和技能指令輸出機(jī)器人接下來(lái)要執(zhí)行的動(dòng)作。但 VLA 有幾個(gè)局限訓(xùn)練數(shù)據(jù)有限機(jī)器人演示遠(yuǎn)少于互聯(lián)網(wǎng)文本和圖像數(shù)據(jù)、只學(xué)會(huì)模仿不一定懂后果、機(jī)器人各不相同、觀察可能過時(shí)。因此需要世界模型幫助判斷做了之后可能發(fā)生什么。從仿真環(huán)境到真實(shí)機(jī)器人并不是再換一種控制器而是要處理兩個(gè)環(huán)境之間的差異訓(xùn)練時(shí)使用遙操作數(shù)據(jù)、視頻數(shù)據(jù)或仿真交互數(shù)據(jù)部署時(shí)同一個(gè)物體出現(xiàn)在不同的背景、光照、相機(jī)位置和遮擋關(guān)系中機(jī)械臂還會(huì)遇到不同的摩擦、傳感器噪聲和執(zhí)行器延遲。小結(jié)順著模態(tài)和執(zhí)行時(shí)機(jī)兩根軸看異步與事件驅(qū)動(dòng)把觀察從Agent 主動(dòng)去取擴(kuò)展為世界主動(dòng)推來(lái)模態(tài)沒變變的只有時(shí)機(jī)。語(yǔ)音把尺度壓到毫秒三種范式的演進(jìn)主線就是從輪流說(shuō)話逐步走向持續(xù)聽說(shuō)。Computer Use 把同一個(gè)閉環(huán)搬到屏幕上瓶頸已從能否完成任務(wù)擴(kuò)展到操作效率、連續(xù)視覺理解和動(dòng)作后的狀態(tài)確認(rèn)。機(jī)器人則把它推到物理世界動(dòng)作分塊在平滑性與反應(yīng)速度之間取舍而最終是否完成仍必須由新的觀察來(lái)判定。四節(jié)共享同一條控制骨架持續(xù)感知、判斷當(dāng)前狀態(tài)與時(shí)機(jī)、選擇回復(fù)或動(dòng)作、讓輸出進(jìn)入環(huán)境、觀察反饋、繼續(xù)或修正或重試或停止或重新規(guī)劃。也共享同一組原語(yǔ)——喚醒、安全點(diǎn)、取消、搶占、快慢分離。這些原語(yǔ)在不同時(shí)間尺度上的實(shí)現(xiàn)差異主要由環(huán)境變化的速度、動(dòng)作的可逆性和觀察的獲取成本決定。本文內(nèi)容整理自開源技術(shù)書《深入理解 AI Agent》(bojieli/ai-agent-book)采用 Apache 2.0 許可證