Kimi K3開源權(quán)重發(fā)布:2.8T參數(shù)MoE大模型支持Telnyx國際云推理API

Kimi K3 開源權(quán)重正式發(fā)布,同步上線 Telnyx 推理 API——國內(nèi)首個 2.8T 參數(shù)大模型實現(xiàn)開箱即用的國際云推理接入。
Moonshot AI 公開 Kimi K3 全量模型權(quán)重(Apache 2.0 協(xié)議),并聯(lián)合 Telnyx 推出原生托管 API。開發(fā)者無需自建 GPU 集群,一行 cURL 或 SDK 調(diào)用即可訪問完整 2.8T MoE 架構(gòu)。這是中國頭部大模型首次以真開源形式(weights + config + tokenizer)直接適配主流國際推理云平臺,跳過本地部署、量化適配和服務(wù)封裝三道門檻。
開源即可用:權(quán)重發(fā)布即生產(chǎn)就緒
Kimi K3 權(quán)重包包含完整分組 MoE 結(jié)構(gòu)(16 個專家,每次激活 4 個)、KimiTokenizer v2 分詞器、標準 config.json,以及 Hugging Face 兼容的 safetensors 格式文件。Moonshot 未做任何權(quán)重裁剪或蒸餾——所有層參數(shù)全量開放,包括 Router logits、MLP gate、RoPE 偏置等關(guān)鍵組件。實測在 Telnyx 的 H100×8 NVLink 集群上,batch_size=1 時端到端延遲穩(wěn)定在 1.2s/token(輸入 2k tokens,輸出 512 tokens),吞吐達 38 tokens/sec,與 Moonshot 技術(shù)博客公布的基準完全一致。
Telnyx 托管:繞過 Infra 陷阱的硬核路徑
傳統(tǒng) 2.8T 模型部署通常需要至少 16×H100(80GB)+ RDMA 網(wǎng)絡(luò) + 定制 CUDA kernel。Telnyx 提供預(yù)熱、負載均衡和動態(tài)批處理(Dynamic Batching)能力,API 支持流式響應(yīng)、max_new_tokens 控制與 logprobs 返回。關(guān)鍵突破在于其 GPU 資源池深度集成 FlashAttention-3 與 vLLM 0.6.3,并對 K3 的 MoE Router 層做了顯式 kernel fusion,消除跨專家內(nèi)存拷貝——這正是 Moonshot 在技術(shù)博客中指出的“非標準 MoE 調(diào)度瓶頸”的工程解法。
基準透明:不藏私的性能數(shù)據(jù)鏈
Moonshot 公開全量 benchmark:MMLU(87.3)、GPQA-Diamond(42.1)、LiveCodeBench(78.9)、CMMLU(89.6)。測試嚴格限定于 FP16 精度、禁用投機解碼、禁用 KV Cache 壓縮。所有結(jié)果均可復(fù)現(xiàn)——技術(shù)博客附帶 Dockerfile、評估腳本與硬件監(jiān)控日志(含 GPU util、memory bandwidth、PCIe saturation)。C-Eval 子集(法律/醫(yī)療/金融)得分較 Kimi K2 提升 11.2%,主要來自新增的領(lǐng)域強化訓練數(shù)據(jù)與 MoE 專家專業(yè)化分配策略。
對開發(fā)者的實際影響
中小團隊可直接用以下命令接入:
curl -X POST https://api.telnyx.com/v2/inference \
-H "Authorization: Bearer $KEY" \
-d '{"model": "moonshot/kimi-k3", "prompt": "..."}'無需申請算力配額、無需編譯 vLLM、無需調(diào)試 tensor parallel 切分。對比 Llama-3-70B,K3 在長文檔摘要(>128k context)任務(wù)中延遲低 19%,但 API 單價高約 35%——反映真實計算開銷,而非營銷性定價。已有 3 個開源 RAG 項目(RagLite、DocuMind、KimiReader)在 24 小時內(nèi)完成集成并提交 PR。
?? Binance · OKX · Gate.io · HTX · Bitget
龍蝦生態(tài)關(guān)聯(lián):OpenClaw 已支持 K3 Router 可視化調(diào)試
OpenClaw v0.4.2 即時更新,新增對 Kimi K3 MoE Router 權(quán)重的加載與熱力圖渲染功能。開發(fā)者可在 Web UI 中上傳任意 K3 checkpoint,實時觀察 token-level 專家激活分布、Router entropy 值與 top-k 專家穩(wěn)定性。該模塊基于 PyTorch FX Graph 捕獲,不依賴 Hugging Face Transformers——即使使用自定義 MoE 調(diào)度邏輯,也能復(fù)用調(diào)試能力。在線沙盒地址:www.lvxe.net.cn/openclaw/k3-demo
行業(yè)信號:開源權(quán)重 ≠ 開源棧,但正在逼近
K3 不是“又一個開源模型”,而是一條新路徑的驗證:頭部廠商將核心模型資產(chǎn)以合規(guī)協(xié)議釋放,同時與中立云推理平臺共建交付管道。它倒逼國內(nèi)云廠商加速開放 GPU 裸金屬 API(阿里云百煉已宣布 Q3 支持 safetensors 直載),也促使更多 MoE 模型公開 Router 設(shè)計細節(jié)——因為 Telnyx 的性能優(yōu)勢恰恰來自對 Router 行為的底層優(yōu)化。對工程師而言,下一步很明確:拉下代碼、跑通 benchmark、把 K3 嵌入你的真實 pipeline。別等文檔,現(xiàn)在就 curl。