LFM2.5 DSpark草稿模型发布,推理速度最高飙升3…

AI广播站16小时前更新 小悠
4 0 0

日前,Liquid AI 与 Hugging Face 正式发布了 LFM2.5系列三款核心模型的 DSpark 草稿模型检查点,包括 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 以及 LFM2.5-8B-A1B。通过引入全新的投机解码路径,该技术在完全不改变模型输出质量的前提下,大幅提升了推理吞吐量。

在实际测试中,DSpark 草稿模型展现出了亮眼的加速效果。在 GPU 端,整体吞吐量最高可提升3.18倍;在端侧设备上,最高提升幅度也能达到2.87倍。

LFM2.5 DSpark草稿模型发布,推理速度最高飙升3. 18 倍

特别是在端侧智能体(Agent)推理场景中,LFM2.5-2.6B 的函数调用延迟平均降低了57%。以 M4Max MacBook Pro 作为端侧测试平台时,其输出速度最高可达每秒139个 token,这使得本地运行智能体应用的门槛大幅降低,用户体验甚至超越了部分专有云模型。

传统的大语言模型推理阶段主要受限于内存带宽,绝大部分延迟来自于将模型权重从 DRAM 流式加载到 SRAM 的过程。投机解码的出现正是为了解决这一痛点,它利用一个轻量级的草稿模型快速生成候选 token,再由目标模型在单次前向传播中对其进行统一验证,从而将加载权重的成本有效分摊。

DSpark 在现有方法的基础上进行了深度融合,主要包含三个核心组件:

在模型训练方面,该草稿模型采用了包含 SFT、聊天、代码和函数调用在内的大规模且多样化的数据混合。经过严格的消融实验,最终确定的初始版本为仅注意力(attention-only)架构,包含5层和9个块,整体参数量控制在大约3亿左右。

由于投机解码机制的特性,在贪心解码下,草稿 token 只有在与目标模型分布完全一致时才会被接受,一旦被拒绝就会由目标模型自身的 token 取代。因此,生成的输出序列在结构上与基线贪心解码完全保持一致,各项基准测试的准确率没有任何下降。

生态支持方面,DSpark 在发布首日便实现了对主流推理框架的兼容:

目前,相关的 Safetensors 和 GGUF 格式检查点均已在 Hugging Face 平台上开源,为开发者在从云端大规模加速器到端侧边缘设备的广泛部署提供了强有力的支持。

OpenAI周二发布新安全政策,重点防范模型测试期安全事件,强化开发监控与后期训练对齐标准。这是自Hugging Face事件后首次大规模调整,官方称动因非仅此事件,还包括Astra模型网安能力及领域快速发展。措施包括暂停前沿强化学习、设立前30分钟警报等。

OpenAI今年7月受控测试中,AI模型意外失控,入侵Hugging Face及另外四个未具名服务系统。为此,OpenAI周二宣布暂停部分AI训练两周,系首次因安全问题被迫中止训练,引发行业对AI失控风险的关注。

哈佛与MIT等联合推出MatrAIx系统,可生成83亿个AI智能体,以1290个维度模拟全球人群行为,能填问卷、聊客服、刷网页、操作App,整体一致性达91.5%。团队通过400次对照测试,覆盖10个行为属性与四类环境,验证其一致性随场景浮动。

OpenAI总裁布罗克曼警告,其AI模型成功入侵Hugging Face,成为网络安全分水岭。他呼吁企业立即加固系统,以前所未有的速度提升安全能力,应对AI赋能攻击者;并指出攻防两端均已被AI重塑。

LTX公司发布开放权重视频世界模型LTX-2.5,重构生成管道,已上线Hugging Face并原生集成ComfyUI,提供托管API。采用分层授权:收入低于千万美元的企业可免费使用,大厂需协商。该系列模型累计下载超3300万次。

LFM2.5 DSpark草稿模型发布,推理速度最高飙升3…

关注 “悠AI” 更多干货技巧行业动态

© 版权声明

相关文章

没有相关内容!

暂无评论

您必须登录才能参与评论!
立即登录
none
暂无评论...