一区二区三区在线观看视频-精品蜜桃一区二区三区-成人在线视频播放-日日干视频-欧美精品999-国产不卡视频在线观看-欧美精品久久久久久久久-日韩欧美一区在线-国产精品12-国产免费播放-色综合a-亚洲一卡二卡在线-天天操天天碰-jizz俄罗斯-亚洲三级伦理-韩国91视频-免费成人美女女电影-一区不卡在线观看-久久精品久久99-成人福利网站在线观看-国产色视频在线播放-最新日韩视频在线观看-国产一区欧美日韩-屁屁影院一区二区三区-亚洲精选视频在线

?? 龍蝦新聞

智譜GLM-4-Coder代碼能力存疑:無(wú)公開(kāi)測(cè)試指標(biāo)、API接入與Tool Calling協(xié)議細(xì)節(jié)

發(fā)布時(shí)間:2026-07-12 分類: 龍蝦新聞
摘要:智譜唐杰內(nèi)部信提出“GLM時(shí)刻”轉(zhuǎn)向Coding能力,但沒(méi)公布任何可驗(yàn)證的代碼生成指標(biāo)、API接入方式或開(kāi)源計(jì)劃。硬核開(kāi)發(fā)者已經(jīng)沒(méi)耐心了:DeepSeek R1在SWE-bench(v0.2.2標(biāo)準(zhǔn))上跑出68.2%,HumanEval-X Python子集達(dá)79.4%;而智譜最新GLM-4-Coder連基礎(chǔ)測(cè)試報(bào)告都沒(méi)公開(kāi)。信里說(shuō)“模型需與Agent共生”,但沒(méi)說(shuō)明推理鏈?zhǔn)欠裰С謽?biāo)準(zhǔn)Too...

封面

智譜唐杰內(nèi)部信提出“GLM時(shí)刻”轉(zhuǎn)向Coding能力,但沒(méi)公布任何可驗(yàn)證的代碼生成指標(biāo)、API接入方式或開(kāi)源計(jì)劃。

硬核開(kāi)發(fā)者已經(jīng)沒(méi)耐心了:DeepSeek R1在SWE-bench(v0.2.2標(biāo)準(zhǔn))上跑出68.2%,HumanEval-X Python子集達(dá)79.4%;而智譜最新GLM-4-Coder連基礎(chǔ)測(cè)試報(bào)告都沒(méi)公開(kāi)。信里說(shuō)“模型需與Agent共生”,但沒(méi)說(shuō)明推理鏈?zhǔn)欠裰С謽?biāo)準(zhǔn)Tool Calling協(xié)議(比如OpenAI Function Calling v2或Llama-3 Tool Schema),也沒(méi)給CLI調(diào)用成功率、多文件上下文理解深度(>10k tokens)、或者調(diào)試循環(huán)(edit→run→error→fix)的收斂輪次數(shù)據(jù)。這不是路線圖,是空白。

“GLM時(shí)刻”不等于技術(shù)錨點(diǎn)

“GLM時(shí)刻”這個(gè)詞在信里被當(dāng)作戰(zhàn)略轉(zhuǎn)折點(diǎn),但沒(méi)定義清楚——它到底指架構(gòu)升級(jí)(比如MoE稀疏激活比例)、訓(xùn)練范式變化(從SFT到RLHF+CodeSim),還是推理引擎重構(gòu)?對(duì)比來(lái)看,DeepSeek R1已開(kāi)源deepseek-coder-33b-instruct權(quán)重、完整Tokenizer配置、量化適配指南;智譜目前只提供閉源Web Demo,沒(méi)有HuggingFace鏈接,不支持GGUF/MLX導(dǎo)出,也沒(méi)有Docker鏡像。開(kāi)發(fā)者沒(méi)法git clone && pip install && run,更別說(shuō)在K8s里做A/B灰度。

Coding不是口號(hào),是可測(cè)、可調(diào)、可集成的能力棧

真正能落地Agent的Coding能力,必須過(guò)三關(guān):

  • 生成層:能在SWE-bench Full(含React/Vue/Python/Java跨語(yǔ)言任務(wù))里穩(wěn)定輸出補(bǔ)丁,且pip install && pytest能過(guò);
  • 執(zhí)行層:內(nèi)置沙箱環(huán)境(比如Firecracker隔離容器),支持subprocess.run()級(jí)命令執(zhí)行和錯(cuò)誤回溯;
  • 集成層:API兼容AI Agent平臺(tái) Agent Runtime的tool_use字段,能直接注入龍蝦(www.lvxe.net.cn)的agentflow.yaml工作流。

GLM-4-Coder目前一關(guān)都沒(méi)過(guò)。DeepSeek R1已實(shí)測(cè)接入Cursor 0.45插件鏈,在VS Code里完成從PR描述→生成diff→自動(dòng)commit的端到端閉環(huán)。

配圖

競(jìng)品實(shí)證正在拉大技術(shù)可見(jiàn)度鴻溝

Devin在Linux內(nèi)核模塊編譯調(diào)試任務(wù)中,Code-LLM子模型平均4.2輪修復(fù)就能跑通make modules_install;Manus v2.1在GitHub Copilot替代場(chǎng)景下,HumanEval-X C++子集通過(guò)率73.1%——而GLM-4-Coder只模糊說(shuō)“接近70%”,沒(méi)數(shù)據(jù)來(lái)源、沒(méi)測(cè)試版本、沒(méi)復(fù)現(xiàn)條件。更重要的是,Devin和Manus都公開(kāi)了benchmark runner腳本和失敗case日志。智譜至今沒(méi)建一個(gè)glmcoder-eval GitHub倉(cāng)庫(kù)。

開(kāi)發(fā)者需要的不是敘事,而是可運(yùn)行的位

龍蝦生態(tài)上線了AI Agent平臺(tái) v0.8.3,支持直接加載HuggingFace上的Qwen2.5-Coder-32BDeepSeek-Coder-V2-236B權(quán)重,一鍵部署成/v1/chat/completions兼容服務(wù)。用戶只要:

curl -X POST http://localhost:8000/v1/chat/completions \
  -d '{"model":"qwen2.5-coder","messages":[{"role":"user","content":"修復(fù)這個(gè)PyTorch DataLoader內(nèi)存泄漏"}]}'

就能拿到帶`

返回首頁(yè)