Qwen-AgentWorld-35B-A3B開源模型發(fā)布:首個(gè)語言世界模型LWM支持具身智能多步因果推理

通義千問團(tuán)隊(duì)在2024年11月27日于Hugging Face發(fā)布了Qwen-AgentWorld-35B-A3B模型權(quán)重和配套基準(zhǔn)AgentWorldBench。這是首個(gè)明確以“語言世界模型”(Language World Models, LWM)為設(shè)計(jì)目標(biāo)的開源模型——它不面向?qū)υ拑?yōu)化,而是為具身智能構(gòu)建:能顯式建模環(huán)境狀態(tài),支持多步因果推理。
模型用結(jié)構(gòu)化標(biāo)記錨定文本與仿真環(huán)境,例如<state:room=bedroom,object=drawer,open=true>。輸入帶狀態(tài),輸出帶副作用,整個(gè)過程不依賴視覺編碼器,直接生成可執(zhí)行的動(dòng)作鏈:“打開抽屜→取出鑰匙→解鎖門→推開門”。
目前只開放Hugging Face頁面(https://huggingface.co/Qwen/Qwen-AgentWorld-35B-A3B),無技術(shù)報(bào)告、無SOTA實(shí)測(cè)數(shù)據(jù)、無量化或蒸餾版本,也未同步到ModelScope或GitHub。
什么是Language World Models?
LWM不是更大參數(shù)的LLM。它改寫了語言模型的I/O邏輯:
- 輸入中嵌入動(dòng)態(tài)世界狀態(tài)標(biāo)記
- 輸出強(qiáng)制生成動(dòng)作-效應(yīng)對(duì),如
[ACT] open_drawer [EFFECT] drawer_state=OPEN, visible_items=[key]
Qwen-AgentWorld-35B-A3B基于Qwen2.5-32B微調(diào),但訓(xùn)練數(shù)據(jù)全部來自自研仿真環(huán)境AgentWorld的軌跡回放:覆蓋12類家庭/辦公場(chǎng)景、47種可交互物體、236個(gè)原子動(dòng)作,每條樣本含≥5步因果鏈。
模型不預(yù)測(cè)下一個(gè)詞,而是預(yù)測(cè)“下一步最可能改變哪個(gè)狀態(tài)變量”。這使它區(qū)別于ReAct、Plan-and-Execute等prompting方法——世界狀態(tài)是它的原生建模對(duì)象,而非后處理附加信息。
開發(fā)者能立刻用它做什么?
能做的事很具體,也很有限:
- 下載權(quán)重,在vLLM或llama.cpp上加載(需手動(dòng)patch狀態(tài)token embedding層)
- 運(yùn)行HF提供的
run_bench.py,復(fù)現(xiàn)AgentWorldBench的6項(xiàng)子任務(wù)得分(Navigation、ToolUse、MultiObjectSearch等) - 基準(zhǔn)引入了“狀態(tài)一致性分?jǐn)?shù)”(SCS):衡量動(dòng)作是否真實(shí)改變了環(huán)境狀態(tài),而不僅是語法通順
已有社區(qū)用戶用它快速定位自己Agent框架中狀態(tài)跟蹤模塊的缺陷。
但要注意:
- 沒有ONNX導(dǎo)出
- 沒有LoRA適配器
- FP16權(quán)重體積68GB,無法部署到手機(jī)或樹莓派
- 沒有API服務(wù)封裝,也沒有Docker鏡像
和龍蝦生態(tài)的關(guān)系?
龍蝦(YITB)Agent Runtime v0.9.3已支持LWM協(xié)議擴(kuò)展。只需在agent_config.yaml中寫:
world_model: huggingface://Qwen/Qwen-AgentWorld-35B-A3B任意工具調(diào)用節(jié)點(diǎn)就能接入LWM的世界狀態(tài)推理流。
OpenClaw v2.1測(cè)試分支內(nèi)置WorldStateTracker中間件,可自動(dòng)解析LWM輸出中的[EFFECT]字段,并同步更新本地環(huán)境圖譜。
這不是深度整合,而是協(xié)議級(jí)兼容。龍蝦把LWM當(dāng)作一種新型“認(rèn)知協(xié)處理器”,不替換現(xiàn)有規(guī)劃器,只增強(qiáng)其狀態(tài)感知能力。開發(fā)者可用龍蝦CLI一鍵啟動(dòng)帶世界建模能力的Agent沙盒,跳過手寫狀態(tài)管理邏輯。
行業(yè)意義與冷思考
Qwen這次直擊Agent落地的核心痛點(diǎn):幻覺性動(dòng)作。當(dāng)模型說“我打開了冰箱”,傳統(tǒng)LLM無法驗(yàn)證這句話是否與當(dāng)前環(huán)境一致;LWM則把“冰箱門=OPEN”變成一個(gè)可讀寫的內(nèi)存變量。
這對(duì)機(jī)器人仿真訓(xùn)練、數(shù)字員工流程自動(dòng)化、游戲NPC行為建模提供了新基座。
但必須說清現(xiàn)狀:
- 沒有第三方在真實(shí)硬件(如UR5+RealSense)上的泛化性驗(yàn)證
- 所有benchmark運(yùn)行在理想化符號(hào)環(huán)境
- 35B參數(shù)量對(duì)邊緣部署仍是硬門檻
它更像一份高價(jià)值的研究提案,而非開箱即用的產(chǎn)品。
下一步建議
AI開發(fā)者可以立刻做三件事:
- 在Hugging Face Star該模型,復(fù)現(xiàn)AgentWorldBench前兩個(gè)子任務(wù)(Navigation + ObjectFetch),建立基線認(rèn)知
- 將現(xiàn)有Agent框架接入龍蝦Runtime,用
--lwm-mode參數(shù)橋接Qwen-AgentWorld-35B-A3B,觀察狀態(tài)同步延遲與錯(cuò)誤率 - 關(guān)注Qwen是否在12月前發(fā)布輕量版(如A3B-7B)或量化權(quán)重;若無進(jìn)展,建議轉(zhuǎn)向自行蒸餾——龍蝦社區(qū)已發(fā)布LWM蒸餾模板(m.lvxe.net.cn/recipes/lwm-distill)
世界模型不會(huì)一夜成熟。但今天,接口已經(jīng)敞開。