Fireworks AI 推出 FireRouter wi…

AI广播站12小时前更新 小悠
6 0 0

Fireworks AI 近日发布 FireRouter with Opus,这是市场上首个缓存感知路由器,针对 Claude Opus 系列进行了优化,并首次以独立路由模型形式作为 serverless 端点开放。经过一个多月的内部 A/B 测试,该方案执行编码任务的准确率达到单独使用 Opus 的98.1%,而成本降低了57%。

FireRouter 的核心逻辑是在每次用户轮次中,评估模型集合中每个模型对当前任务的适合程度,估算每个模型的处理成本(包括提示缓存成本),并权衡切换模型带来的节省与丢失缓存是否值得,最终路由到质量与成本之间取得最佳平衡的模型。目前路由池包含 Claude Opus5.5、GLM5.3和 GLM5.3Flash,随着新模型发布将持续调整。

Fireworks AI 推出 FireRouter with Opus:编码任务成本降 57%,准确率仅损失 1.5 个百分点

测试数据来自内部编码流量,会话被随机分配到 FireRouter with Opus 组或仅使用 Opus 的对照组,工作负载和用户均相同。结果显示,每次会话成本从15.36美元降至6.63美元,降幅57%(±19个百分点,95% 置信区间)。准确率方面,FireRouter with Opus 在评分轮次中得分78.7%,而仅使用 Opus 为80.2%,差距仅1.5个百分点(±1.3),即达到 Opus 整体准确率的98.1%。

缓存命中率方面,FireRouter with Opus 为94.2%,单独使用 Opus 为97.8%,差距3.6个百分点。Fireworks AI 解释称,这是一个微小而有意的取舍——由于内部编码工作中开源模型可以处理许多常规轮次,缓存感知路由通过将简单任务分流至更便宜的模型,大幅降低了整体成本。

FireRouter with Opus 现已集成至 Claude Code、Codex、Cursor IDE 等多个工具链。用户可通过 `fireconnect login` 和 `fireconnect claude –model firerouter/opus` 两行命令启用。Fireworks AI 表示,其 Fireworks Nexus 解决方案旨在让工程团队将领先的开源模型接入现有工具链,在不牺牲速度或质量的前提下将支出减半。

爆料称Claude Opus 5.5(代号claude-wafer-eap)已开启内测,或于本周二突然发布,版本跳过5.2。其定价为每百万Token输入4美元、输出20美元,低于现役Opus 5的5/25美元,被视为直接对标GPT-6。

马斯克宣布Grok4.5模型在SpaceX与特斯拉内部启动Beta测试,基于1.5万亿参数V9模型,训练中融入Cursor编程数据,性能已接近或超越Claude Opus,强化学习仍在优化中。

近日马斯克在社交平台宣布,新一代大语言模型Grok 4.5已在SpaceX和特斯拉启动内部私测,从实验室迈向复杂工业场景。该模型以1.5万亿参数V9架构为基座,引入AI编程工具Cursor进行补充训练,以增强逻辑推理能力,推动AI在航天与汽车领域实际部署。

Anthropic推出Claude顾问工具,创新混合智能模式:小模型全程执行任务,遇到复杂决策时自动向大模型寻求策略建议。颠覆传统Agent构建思路,实现性价比最优解。

Cursor团队测试发现,GPT-5.2在构建复杂Web浏览器等长周期编程任务中,比Claude Opus4.5更可靠。测试涉及HTML解析、CSS布局和JavaScript虚拟机等底层开发,GPT-5.2在需要数百万行代码的“长跑式”项目中表现更优。

Fireworks AI 推出 FireRouter wi…

关注 “悠AI” 更多干货技巧行业动态

© 版权声明

相关文章

没有相关内容!

暂无评论

您必须登录才能参与评论!
立即登录
none
暂无评论...