一区二区三区在线观看视频-精品蜜桃一区二区三区-成人在线视频播放-日日干视频-欧美精品999-国产不卡视频在线观看-欧美精品久久久久久久久-日韩欧美一区在线-国产精品12-国产免费播放-色综合a-亚洲一卡二卡在线-天天操天天碰-jizz俄罗斯-亚洲三级伦理-韩国91视频-免费成人美女女电影-一区不卡在线观看-久久精品久久99-成人福利网站在线观看-国产色视频在线播放-最新日韩视频在线观看-国产一区欧美日韩-屁屁影院一区二区三区-亚洲精选视频在线

?? 龍蝦新聞

DeepSeek暫停融資背后:國(guó)產(chǎn)萬(wàn)卡集群互連帶寬瓶頸致算力損失3.2倍

發(fā)布時(shí)間:2026-07-28 分類: 龍蝦新聞
摘要:DeepSeek官方暫停新一輪融資。Hacker News上泄露的一份內(nèi)部技術(shù)備忘錄首次披露:在相同模型規(guī)模下,中美萬(wàn)卡級(jí)訓(xùn)練集群的實(shí)際有效算力相差3.2倍——這直接導(dǎo)致模型收斂慢47%,128K+上下文窗口難以穩(wěn)定運(yùn)行,多模態(tài)對(duì)齊階段GPU顯存溢出率升至原來(lái)的3.8倍。泄露文件揭示的真實(shí)瓶頸備忘錄指出,DeepSeek-VL多模態(tài)訓(xùn)練中,Vision Transformer與LLM主干之間...

封面

DeepSeek官方暫停新一輪融資。Hacker News上泄露的一份內(nèi)部技術(shù)備忘錄首次披露:在相同模型規(guī)模下,中美萬(wàn)卡級(jí)訓(xùn)練集群的實(shí)際有效算力相差3.2倍——這直接導(dǎo)致模型收斂慢47%,128K+上下文窗口難以穩(wěn)定運(yùn)行,多模態(tài)對(duì)齊階段GPU顯存溢出率升至原來(lái)的3.8倍。

泄露文件揭示的真實(shí)瓶頸

備忘錄指出,DeepSeek-VL多模態(tài)訓(xùn)練中,Vision Transformer與LLM主干之間的梯度同步延遲平均為89ms(美國(guó)同類集群為28ms)。根本原因在于國(guó)產(chǎn)互連帶寬僅1.2TB/s,而NVLink 5.0已達(dá)3.6TB/s。
長(zhǎng)上下文微調(diào)時(shí),F(xiàn)lashAttention-3在昇騰910B集群上的吞吐量只有A100的58%。問(wèn)題出在自定義kernel未適配昇騰CANN 7.0的異步內(nèi)存調(diào)度機(jī)制。

MoE與算子壓縮成破局關(guān)鍵

團(tuán)隊(duì)已將R1推理架構(gòu)切換為動(dòng)態(tài)稀疏MoE:每Token只激活2/8個(gè)專家。8B模型在單機(jī)8卡上,128K上下文的KV緩存從32.6GB壓到19.3GB。
更關(guān)鍵的是,開(kāi)源工具包 ds-kernel-pack 已集成17個(gè)國(guó)產(chǎn)芯片專用算子,包括針對(duì)寒武紀(jì)MLU370優(yōu)化的FP16×INT4混合GEMM。在DeepSeek-Coder-33B代碼生成任務(wù)中,實(shí)測(cè)提速2.1倍。

?? Binance · OKX · Gate.io · HTX · Bitget

開(kāi)源策略倒逼工程創(chuàng)新

融資暫停反而加快了技術(shù)透明化節(jié)奏:

  • DeepSeek-VL v2.1移除全部閉源視覺(jué)編碼器,改用Qwen-VL-Open權(quán)重 + 自研Cross-Modal Adapter,訓(xùn)練成本降34%;
  • R1發(fā)布時(shí)同步開(kāi)源 torch_npu_fused_rmsnormascend_flash_attn,GitHub Star在48小時(shí)內(nèi)突破2.3k;
  • 龍蝦(Lobster)生態(tài)已接入該適配層,OpenClaw Agent開(kāi)發(fā)者可直接調(diào)用:

    claw.run("deepseek-r1-npu")

國(guó)產(chǎn)芯片協(xié)同進(jìn)入深水區(qū)

備忘錄附錄強(qiáng)調(diào):當(dāng)前瓶頸不在單卡峰值算力,而在“系統(tǒng)級(jí)算力兌現(xiàn)率”。A100集群實(shí)際訓(xùn)練效率達(dá)理論值68%,主流國(guó)產(chǎn)方案平均僅31%。
突破點(diǎn)正轉(zhuǎn)向軟硬協(xié)同:

  • 華為已向DeepSeek開(kāi)放昇騰910C底層Tensor Core調(diào)度權(quán)限;
  • 壁仞B(yǎng)R100聯(lián)合DeepSeek完成INT8量化感知訓(xùn)練(QAT)全流程驗(yàn)證,預(yù)計(jì)Q4支持R1全參數(shù)微調(diào)。

訓(xùn)練集群無(wú)法線性擴(kuò)展時(shí),競(jìng)爭(zhēng)力來(lái)自三件事:更聰明的架構(gòu)選擇、更極致的算子榨取、更開(kāi)放的協(xié)作接口。
對(duì)開(kāi)發(fā)者來(lái)說(shuō),現(xiàn)在就是切入國(guó)產(chǎn)大模型工程棧的好時(shí)機(jī):

git clone https://github.com/deepseek-ai/r1-npu.git
cd r1-npu && lobster deploy --device ascend

跑通第一個(gè)128K上下文推理實(shí)例——真實(shí)瓶頸,總是在跑起來(lái)之后才真正浮現(xiàn)。

返回首頁(yè)