
文章總結(jié)與翻譯一、主要內(nèi)容本文聚焦于利用大型語(yǔ)言模型(LLMs)自動(dòng)化認(rèn)知走查(CW)這一可用性測(cè)試方法,核心探索LLMs能否模擬人類在CW中的行為,以降低傳統(tǒng)測(cè)試的成本和資源消耗。研究設(shè)計(jì)雙角色LLM代理架構(gòu):設(shè)計(jì)了 facilitator(引導(dǎo)者)和 evaluator(評(píng)估者)兩個(gè)AI代理,分別模擬CW中的研究人員引導(dǎo)角色和用戶評(píng)估角色,通過(guò)迭代優(yōu)化的提示詞實(shí)現(xiàn)界面導(dǎo)航、思維外顯和流程推進(jìn)。兩項(xiàng)對(duì)比研究:研究1:對(duì)比GPT-4、Gemini-2.5-pro與10名人類評(píng)估者在兩款移動(dòng)應(yīng)用(語(yǔ)言學(xué)習(xí)類、旅行預(yù)訂類)上的CW表現(xiàn),從任務(wù)完成率、導(dǎo)航路徑一致性、潛在失敗點(diǎn)識(shí)別三個(gè)維度展開分析。研究2:探索通過(guò)額外提示詞優(yōu)化LLM對(duì)人類潛在失敗點(diǎn)的預(yù)測(cè)能力,對(duì)比“有上下文”(LLM完整走查流程)和“無(wú)上下文”(僅單屏獨(dú)立評(píng)估)兩種模式的效果。核心發(fā)現(xiàn)LLM與人類的行為差異:LLM的任務(wù)完成率更高(GPT-4達(dá)100%,Gemini-2.5-pro達(dá)97.2%,人類為88.2%),導(dǎo)航路徑更接近最優(yōu)路徑,步驟更少;人類評(píng)估者在不確定下一步時(shí)更傾向于廣度優(yōu)先搜索(探索性行為),且易受記憶誤差影響;LLM則更理性,優(yōu)先選擇最可能的