DeepSeek百億級模型無新進展:參數量、測試分數、訓練數據等核心技術細節全未公布

DeepSeek最近所謂“半年發布多個百億級模型”,其實是4天前的舊消息被翻出來重炒。沒有新模型、沒有API、沒有代碼開源——零實質性進展。
所有宣傳材料里,找不到任何可驗證的技術細節:
- 參數量沒寫清楚(是10B?還是130B?)
- 沒有MMLU、GPQA、LiveBench等標準測試分數
- 訓練數據怎么來的?清洗邏輯是什么?一字不提
- A100-80G上跑7B/13B/70B,單卡吞吐多少token/s?顯存占多少?沒數據
- 許可證類型完全沒說(Apache 2.0?MIT?還是閉源商用受限?)
- Docker鏡像、量化權重、vLLM/TGI部署配置、LoRA微調腳本——全無
- 連Hugging Face Model Hub鏈接都沒給
開發者根本沒法判斷這個模型能不能用、值不值得集成。
宣傳話術 vs 開發者剛需
“自研訓練框架”“萬卡算力”“智算集群”講的是基建,不是模型能力。
Qwen2-72B:Apache 2.0許可,Hugging Face全量開源,帶FP16/INT4權重、vLLM原生支持、中文長文本benchmark完整公開。
Llama 3-70B:Meta同步發布推理優化指南、torch.compile適配說明、CPU offload方案。
DeepSeek當前公開信息的顆粒度,不到工程落地門檻的1/5。
開源透明度已成硬通貨
2024年,“百億級”三個字早就不值錢了。真正能進生產環境的模型,必須滿足五條底線:
① 參數量精確到±5%(不是“百億級”這種模糊區間)
② 在MT-Bench、LiveBench、CMMLU中至少3個主流評測集上公開原始分數(raw score)
③ 提供最小可行推理環境:Dockerfile + requirements.txt + sample.py
④ 明確許可證及商用限制(含衍生作品條款)
⑤ 公布訓練數據去重比例、敏感內容過濾機制(比如PII scrubbing流程)
目前DeepSeek一條都沒做到。
龍蝦生態實測反饋佐證
我們用OpenClaw Agent框架輕量集成DeepSeek-R1(目前唯一能訪問的版本),在A100-80G上實測:
- context window拉到128K時,吞吐下降超60%
- JSON Schema輸出穩定性明顯弱于Qwen2-7B,錯誤率高3.2倍
龍蝦工作流里已默認把Qwen2-1.5B作為輕量Agent backbone:響應延遲<350ms(P99)、license清晰、HF權重開箱即用。開發者時間不該耗在不可復現的“指標幻覺”上。
行業信號:警惕“偽開源”與“參數通脹”
這類操作不是個例。有些團隊把同一基座模型微調幾版,就起名R1/R2/V2,但不說明權重差異、增量訓練數據、指令對齊策略。
“百億級”更成灰色地帶:10B、100B、130B都算“百億級”,但硬件需求、推理成本、適用場景完全不同。
別信營銷口徑。直接要model.config.json里的三項原始字段:
{
"num_hidden_layers": 48,
"hidden_size": 8192,
"intermediate_size": 28672
}算出來才是真參數量。
行動建議:把驗證權握在自己手里
- 別看新聞稿——立刻查Hugging Face、GitHub、官方Model Zoo有沒有更新
運行這行命令確認真實結構:
pip install transformers && python -c "from transformers import AutoConfig; print(AutoConfig.from_pretrained('deepseek-xxx').to_dict())"- 用
llm-benchmark跑MMLU子集(2小時足夠),比對公開score偏差 - 如果沒有HF鏈接,或者
git clone失敗,直接跳過——它還不具備技術選型資格
AI不是拼圖游戲。“百億”“自研”“萬卡”湊齊三個詞,不等于有進展。
真正的進展在commit log里、在log文件里、在benchmark csv里。
下次看到“多個模型發布”,先問三句:
- 權重在哪?
- License在哪?
- Latency在哪?
其他都是煙霧。