DeepSeek暫停融資背后:國(guó)產(chǎn)萬(wàn)卡集群互連帶寬瓶頸致算力損失3.2倍

DeepSeek官方暫停新一輪融資。Hacker News上泄露的一份內(nèi)部技術(shù)備忘錄首次披露:在相同模型規(guī)模下,中美萬(wàn)卡級(jí)訓(xùn)練集群的實(shí)際有效算力相差3.2倍——這直接導(dǎo)致模型收斂慢47%,128K+上下文窗口難以穩(wěn)定運(yùn)行,多模態(tài)對(duì)齊階段GPU顯存溢出率升至原來(lái)的3.8倍。
泄露文件揭示的真實(shí)瓶頸
備忘錄指出,DeepSeek-VL多模態(tài)訓(xùn)練中,Vision Transformer與LLM主干之間的梯度同步延遲平均為89ms(美國(guó)同類集群為28ms)。根本原因在于國(guó)產(chǎn)互連帶寬僅1.2TB/s,而NVLink 5.0已達(dá)3.6TB/s。
長(zhǎng)上下文微調(diào)時(shí),F(xiàn)lashAttention-3在昇騰910B集群上的吞吐量只有A100的58%。問(wèn)題出在自定義kernel未適配昇騰CANN 7.0的異步內(nèi)存調(diào)度機(jī)制。
MoE與算子壓縮成破局關(guān)鍵
團(tuán)隊(duì)已將R1推理架構(gòu)切換為動(dòng)態(tài)稀疏MoE:每Token只激活2/8個(gè)專家。8B模型在單機(jī)8卡上,128K上下文的KV緩存從32.6GB壓到19.3GB。
更關(guān)鍵的是,開(kāi)源工具包 ds-kernel-pack 已集成17個(gè)國(guó)產(chǎn)芯片專用算子,包括針對(duì)寒武紀(jì)MLU370優(yōu)化的FP16×INT4混合GEMM。在DeepSeek-Coder-33B代碼生成任務(wù)中,實(shí)測(cè)提速2.1倍。
?? Binance · OKX · Gate.io · HTX · Bitget
開(kāi)源策略倒逼工程創(chuàng)新
融資暫停反而加快了技術(shù)透明化節(jié)奏:
- DeepSeek-VL v2.1移除全部閉源視覺(jué)編碼器,改用Qwen-VL-Open權(quán)重 + 自研Cross-Modal Adapter,訓(xùn)練成本降34%;
- R1發(fā)布時(shí)同步開(kāi)源
torch_npu_fused_rmsnorm和ascend_flash_attn,GitHub Star在48小時(shí)內(nèi)突破2.3k; 龍蝦(Lobster)生態(tài)已接入該適配層,OpenClaw Agent開(kāi)發(fā)者可直接調(diào)用:
claw.run("deepseek-r1-npu")
國(guó)產(chǎn)芯片協(xié)同進(jìn)入深水區(qū)
備忘錄附錄強(qiáng)調(diào):當(dāng)前瓶頸不在單卡峰值算力,而在“系統(tǒng)級(jí)算力兌現(xiàn)率”。A100集群實(shí)際訓(xùn)練效率達(dá)理論值68%,主流國(guó)產(chǎn)方案平均僅31%。
突破點(diǎn)正轉(zhuǎn)向軟硬協(xié)同:
- 華為已向DeepSeek開(kāi)放昇騰910C底層Tensor Core調(diào)度權(quán)限;
- 壁仞B(yǎng)R100聯(lián)合DeepSeek完成INT8量化感知訓(xùn)練(QAT)全流程驗(yàn)證,預(yù)計(jì)Q4支持R1全參數(shù)微調(diào)。
訓(xùn)練集群無(wú)法線性擴(kuò)展時(shí),競(jìng)爭(zhēng)力來(lái)自三件事:更聰明的架構(gòu)選擇、更極致的算子榨取、更開(kāi)放的協(xié)作接口。
對(duì)開(kāi)發(fā)者來(lái)說(shuō),現(xiàn)在就是切入國(guó)產(chǎn)大模型工程棧的好時(shí)機(jī):
git clone https://github.com/deepseek-ai/r1-npu.git
cd r1-npu && lobster deploy --device ascend跑通第一個(gè)128K上下文推理實(shí)例——真實(shí)瓶頸,總是在跑起來(lái)之后才真正浮現(xiàn)。