world-model-optimizer開源:輕量級Agent世界模型優化器支持Llama-3/Qwen2/DeepSeek-V3在線微調

world-model-optimizer 開源:Agent 開發者終于有了開箱即用的世界模型優化器
world-model-optimizer 正式開源。它不是另一個世界模型訓練框架,而是一個專為 Agent 場景設計的輕量級優化器:用純文本定義工具行為,讓模型在真實調用鏈中持續在線微調;實測響應仿真精度接近 Fable 等方案,推理 token 減半,原生支持 Llama-3、Qwen2、DeepSeek-V3、Phi-3 等主流開源模型。部署即用,迭代當天見效。
為什么 Agent 需要“可演化的世界模型”
多數 Agent 框架靠靜態工具描述或硬編碼 schema 運行。Slack API 升級、CLI 參數變動、甚至一個新錯誤碼出現,整個推理鏈就崩。world-model-optimizer 不 mock 服務,也不依賴多模態仿真引擎。它把工具行為壓縮成結構化文本——比如 curl -X POST https://api.slack.com/chat.postMessage 的輸入約束、輸出格式、常見錯誤碼、速率限制邏輯,全部寫進 YAML + Markdown 混合文件。模型不用 GPU 就能“預演”上千次調用路徑,生成高質量訓練信號。
輕量、在線、閉環:三個技術錨點撐起生產落地
- 輕量:核心優化器僅 280 行 Python,不依賴 PyTorch/Triton,CPU 即可運行;每個工具的世界模型描述平均 <5KB,可 Git 版本管理、可 PR 評審
- 在線:內置增量訓練調度器。當用戶 query 觸發未覆蓋的邊界 case(例如“把 Excel 轉成帶格式 PDF 并郵件發送”),系統自動捕獲失敗軌跡 → 生成反事實樣本 → 觸發 LoRA 微調 → 熱加載新權重,全程 <90 秒
- 閉環:配套
wmo-evalCLI 工具,一鍵比對優化前后在 ToolBench、AgentBench 上的成功率與 token 消耗,支持按 domain(如 DevOps/CRM/Research)隔離評估
實測數據:HuggingFace ToolCall 基準上,Qwen2-7B-Agent 經 world-model-optimizer 微調后,任務完成率從 63.2% 提升至 89.7%,單次推理平均 token 從 412 降至 205——算力減半,準確率反升。
不是替代,而是補位:它如何嵌入現有 Agent 工作流
world-model-optimizer 不重寫你的 Agent 框架。它只解決一個長期被忽略的問題:模型能力與現實工具生態之間的演化鴻溝。你繼續用 LangChain 或 LlamaIndex 編排流程,用 Ollama 或 vLLM 托管模型。wmo 只做一件事——持續告訴模型:“這個世界此刻長什么樣”。
它輸出三樣東西:
- 可插拔的 LoRA 適配器
- 標準化的 tool-spec JSON Schema
- 帶置信度標注的仿真日志
OpenClaw(龍蝦)生態已集成進 claw-train 命令:
claw-train --wmo --base qwen2:7b即可啟動端到端優化流水線。
?? Binance · OKX · Gate.io · HTX · Bitget
開源即可用:GitHub 倉庫已上線,社區進展明確
項目地址:github.com/silennai/world-model-optimizer
包含完整文檔、6 個真實工具的 world-spec 示例(GitHub API、FFmpeg CLI、Python REPL、Notion API 等)、Docker 一鍵部署腳本。首周獲 237 star,社區已提交針對 Cursor 插件、Devin-style 代碼沙盒、Manus 本地 Agent 的適配 PR。所有模型權重兼容 GGUF 格式;未來三個月將支持量化微調(Q4 LoRA + AWQ 雙路徑)。
下一步:從“仿真世界”走向“協商世界”
當前版本聚焦單 Agent 單工具鏈仿真。團隊已在預研多 Agent 協同建模模塊:讓不同 Agent 對同一 API(如 AWS EC2)各自生成世界描述,再通過共識機制收斂出更魯棒的接口契約。這對構建可信企業級 Agent 集群至關重要。
現在就是入場時機:挑一個你最常調用的工具,運行
wmo init --tool github生成初始 world spec,跑通第一次在線微調。世界不會靜止,你的 Agent 也不該停在 v1.0。