world-model-optimizer開源:輕量文本世界建模器提升Agent推理準確率至92.3%

world-model-optimizer 開源:專為 Agent 優化的文本世界建模器
world-model-optimizer 現已開源——它不微調大模型權重,也不依賴黑盒蒸餾。它用可驗證的文本世界建模(Text World Modeling)持續提升專用 Agent 的性能。
工具復現了 QwenAgentWorld 的核心范式:構建輕量、可執行、帶狀態反饋的仿真環境。Agent 在模擬的真實請求流中自主迭代路由策略與響應邏輯。
在金融客服和運維診斷兩類任務上,推理準確率達 92.3%,接近 Fable 基準(93.1%)。全周期訓練 + 部署開銷降至傳統 LoRA 微調方案的 47%。所有中間態世界模型、獎勵信號、優化軌跡全部開源,可完整復現。
核心思路:建世界,而不是改參數
world-model-optimizer 不動模型權重,只建世界。
它把真實 API 調用鏈、工具返回格式、用戶糾錯反饋等結構化為可解析的文本世界狀態機(State Machine),支持動態注入延遲、錯誤碼、部分響應等生產噪聲。
例如,優化一個對接 Jira + Slack 的運維 Agent 時,工具自動構造包含“Jira ticket 創建成功但 Webhook 超時”“Slack 消息發送被 rate limit 攔截”等 17 類邊緣 case 的世界子圖,并生成對應推理路徑的 reward trace。
整個流程無需 GPU 集群:單卡 A100,2 小時內完成一輪世界建模 + 策略蒸餾,輸出 <5MB 的輕量 Router 模塊,可直接嵌入龍蝦 Agent 或 OpenClaw Runtime 的決策層。
技術棧:純 PyTorch + LangChain,無閉源依賴
代碼庫(GitHub: silennai/world-model-optimizer)采用三層設計:
- 底層
WorldSimulator:用 LLM-as-Judge 生成帶因果鏈的測試用例 - 中層
RewardCompiler:將用戶隱式反饋(重試、跳過、編輯發送)編譯為稀疏 reward 信號 - 頂層
RouterTrainer:用 PPO-Lagrange 對齊多源模型(Frontier LLM + OS-native tool caller + local cache retriever)的調度權重
依賴僅限:
torch>=2.1langchain-core==0.2.10datasets
所有 benchmark 數據集(含 3 個脫敏的真實 Agent 日志樣本)隨代碼發布。Docker 鏡像內置 CI 流水線,運行 make test 即可一鍵復現論文 Table 3 全部結果。
?? Binance · OKX · Gate.io · HTX · Bitget
對龍蝦與 OpenClaw 開發者的實際價值
龍蝦 Agent 開發者可直接接入 lobster-core 的 agent_optimizer 插件點——只需定義 tool_schema 與 feedback_hook,即可啟動世界建模閉環。
某電商售后 Agent 接入后,退貨政策問答的幻覺率從 18.6% 降至 3.2%,Router 模塊推理延遲穩定在 47ms(原始 Qwen2-7B 為 320ms)。
OpenClaw 生態更簡單:world-model-optimizer 輸出的 Router JSON Schema 天然兼容 OpenClaw 的 ActionPlan 協議。開發者可直接將其作為 planner 子模塊熱替換,無需修改任何執行引擎代碼。
中小團隊用 1/3 預算,就能跑出接近 Manus 級 Agent 的線上穩定性。
它解決了什么問題?
當前 Agent 優化有兩個痛點:
- 微調成本高:一次 LoRA 微調需 8×A100×24h
- 效果不可歸因:“為什么這個 prompt 變好了?” 沒人說得清
world-model-optimizer 把優化對象從“模型權重”轉向“世界表征”。每次性能提升都可追溯到具體世界狀態節點,比如:
“修復了 AWS Lambda timeout 場景下的重試邏輯”
Agent 工程正在進入新階段:開發者不再競相堆卡訓大模型,而是競相構建更精準、更廉價、更可審計的文本世界。當世界模型成為 Agent 的“數字孿生沙盒”,自主進化才真正具備可擴展基礎。