模型能够完成本地部署,并不意味着它在真实业务场景中能够游刃有余。在具体的业务流程中,AI不仅需要具备基础的对话能力,还必须精准理解复杂的规则、遵守安全边界,并正确调用外部工具以输出符合规范的结果。为了攻克这一痛点,蚂蚁ASystem团队联合开源社区共同维护的本地化大模型后训练工具包AReno,近日携手百灵大模型推出了一条轻量级的后训练实践路径,成功在单机环境中打通了Agentic RL(强化学习)闭环。
为了确保整个技术方案具备高度的可复现性,本次合作选取了规则清晰、反馈直接的井字棋作为最小验证任务。实验基于DGX Spark硬件环境,对拥有7.9B总参数但激活参数仅为1.3B的Ling-3.0-tiny模型展开了后训练。在训练初期,模型虽然能够理解基本规则,但在交互过程中仍会出现非法动作;而通过将任务规则转化为精确的Reward反馈机制,并借助GSPO算法进行400个步骤的训练后,模型的奖励均值明显提升,输出长度也随之收敛。复测结果充分证明,模型在工具调用与动作选择上的稳定性与合理性得到了质的飞跃。

这一探索的核心价值在于验证了一条透明、可复现的任务适配方法论:从精准发现错误、定义可验证反馈,到完成本地训练并回到同一环境进行复测。该模式不仅适用于棋类实验,更可以流畅迁移至工具调用修复、结构化字段抽取、领域指令遵循以及业务流程智能体等多元化的真实生产场景中。
目前,Ling-3.0-tiny已提供BF16、FP8和INT4等多种开源版本,开发者可通过Hugging Face或魔搭社区获取并使用,同时也可以访问AReno开源仓库参与后续的代码共建与技术讨论。
微软宣布,Copilot语音模式中会做表情的黄色小团子Mico将不再出现在聊天界面,并迁移至Learn Live学习平台,以便“有更多可反应的内容”。Mico去年10月才上线,距今不到一年。微软AI CEO穆斯塔法·苏莱曼曾称其旨在赋予聊天机器人“身份感”。该变动最早由GeekWire报道。
MiniMax推出音乐生成模型MiniMax-Music3,输入歌词与音乐描述即可生成最长5分钟完整歌曲,输出32kHz、16-bit立体声WAV。其采用分层自回归架构,两模型分工:全局语言模型Global LLM参数8B,逐帧预测首个RVQ码本,负责歌曲长程语义与结构变化;该模型由Qwen3-8B初始化,训练时先让嵌入层和输出层适配音乐。
DeepSeek-V4-Pro-0813在硅基流动Day-0首发,主打1M上下文、低/高/最大三档推理强度,重心转向编码、工具调用与智能体工作流,维持MIT开源。定价为输入每百万token 1.32美元、输出3.96美元,缓存命中仅0.44美元,缓存成本优势显著。
金山办公“灵犀专业版”于2026年8月14日接入DeepSeek-V4-Pro正式版,用户无需配置,手动切换即可体验。该模型支持100万token超长上下文,单次最大输出38.4万token,基准测试较Preview全面提升,落地场景具差异化优势。
贾樟柯编剧新片《敦煌妈妈》备案立项,讲述敦煌独居母亲借助AI排解寂寞、了解外界,最终完成横穿中国之旅。主演赵涛、廖凡,预计2027年上映。

关注 “悠AI” 更多干货技巧行业动态