国产 GPU 也能跑万亿大模型:海光 DCU 适配 Kim…

国产算力第一次把万亿参数级的模型稳稳托住了。海光信息宣布,已完成 Kimi K3在其 DCU 平台上的全栈适配与性能验证——这意味着,跑动这类庞然大物的,不再只是少数几款海外旗舰芯片。

海光 DCU 从底层算子一路优化到推理引擎,模型代码无需任何改动就能直接跑起来,迁移成本几乎压到零,开发者拿到算力即可上线部署,兼容性相当从容。针对 KDA 注意力与896专家组成的 MoE 架构,海光做了算子级的定制打磨;哪怕896个专家同时并行,在百万级上下文的重载场景下,推理依旧高效稳定,不会卡顿。

国产 GPU 也能跑万亿大模型:海光 DCU 适配 Kimi K3,896 专家并行不卡顿

落到场景上,K3在海光 DCU 上能撑起长程智能体工程、视觉闭环创作乃至自主芯片设计这类前沿玩法,国产算力用户也终于能亲手跑通万亿级的开源模型。值得补一笔的是,月之暗面在发布 K3之前,便已联合海光与中科曙光完成了完整的兼容性调优:曙光基于海光 DCU 硬件栈,打通了 Kimi MoE 架构的分布式训练与多卡并行推理链路;海光 DCU 则靠底层硬件与软件栈的协同优化,在曙光8000集群上让长文本推理稳稳运行。

官方实测给出了一颗定心丸:国产卡的性能折损被控制在12% 以内,已经达到商用部署的门槛。当万亿模型与国产 GPU 之间的那道墙被推开一道缝,智能时代的算力版图,正悄悄挪动。

Kimi K3权重昨夜在Hugging Face开源后,讽刺一幕立即上演:尽管美国政府与Anthropic等斥巨资游说封杀中国开源模型,至少18家美国企业仍第一时间完成部署并对外提供商业服务。网友Ding汇总的名单,将华盛顿的政治叙事与硅谷的务实理性之间的裂痕暴露无遗,顶级性能与极致性价比让商业理性压倒政治表态。

月之暗面将Kimi K3完整模型权重上传至Hugging Face,技术报告同步公开。该模型总参数2.8万亿、激活1040亿,支持100万token上下文,成为全球首个3万亿参数级开放权重模型。自7月16日API首发后仅11天,K3在Artificial Analysis智能指数中以57分位列全球第三,仅次于Claude Fable5和GPT-5.6 Sol。

7月28日,月之暗面发布Kimi K3模型权重及技术报告,同步开源MoonEP、FlashKDA和AgentEnv三项关键基础设施技术。Kimi K3为目前最强模型,采用MoE架构,总参数达2.8万亿。这三项技术为大规模训练的效率、稳定性及智能体任务执行,提供了核心底层支撑。

月之暗面在北京酒吧举办庆功会,庆祝Kimi K3大模型高热度发布。现场屏幕公布产品规划:K3定位扩容升级,下一代K4将打磨至极高水准,并喊出“冲上月球”口号,展现团队进取雄心。

月之暗面在京举办庆功活动,庆祝Kimi K3大模型发布后获广泛关注。现场“K3扩容升级”“K4干到极致”“冲上月球”等标语,凸显市场对算力扩容的强烈需求,并宣示研发下一代K4的野心。联合创始人张予彤疑似现身。

国产 GPU 也能跑万亿大模型:海光 DCU 适配 Kim…

关注 “悠AI” 更多干货技巧行业动态

© 版权声明

相关文章

没有相关内容!

暂无评论

您必须登录才能参与评论!
立即登录
none
暂无评论...