MiniMax 今天推出了音乐生成模型 MiniMax-Music3,输入歌词和音乐描述,就能生成最长5分钟的完整歌曲,输出为32kHz、16-bit 立体声 WAV 文件。
支撑这个能力的是一套分层自回归架构,两个模型各司其职、上下配合。全局语言模型 Global LLM 参数规模8B,逐帧预测第1个 RVQ 码本,专门负责建模歌曲的长程语义与结构变化——它是从 Qwen3-8B 初始化来的,训练时先让嵌入层和输出层适配音乐语义词元,再与局部模型联合建模全部码本;局部语言模型 Local LLM 参数只有0.6B,负责预测每一帧里其余的声学码本,把细粒度的声学信息一点点补回来。一个大模型管结构骨架,一个小模型填声音血肉,分工相当清晰。

官方表示,模型能在长音频中稳稳守住音乐主题、节奏、歌声身份和编曲的推进,前奏、主歌、预副歌、副歌、桥段、器乐间奏、尾奏这些结构一个不落。官方已在 GitHub 放出模型页面,并提供生成的歌曲示例供试听。
地址:https://huggingface.co/MiniMaxAI/MiniMax-Music3
DeepSeek-V4-Pro-0813在硅基流动Day-0首发,主打1M上下文、低/高/最大三档推理强度,重心转向编码、工具调用与智能体工作流,维持MIT开源。定价为输入每百万token 1.32美元、输出3.96美元,缓存命中仅0.44美元,缓存成本优势显著。
本地部署大模型不等于胜任真实业务,AI还需精准理解复杂规则、遵守安全边界、正确调用外部工具。针对这一痛点,蚂蚁ASystem团队联合开源社区维护的本地化后训练工具包AReno,携手百灵大模型推出轻量级后训练实践路径,以提升模型业务落地能力。
金山办公“灵犀专业版”于2026年8月14日接入DeepSeek-V4-Pro正式版,用户无需配置,手动切换即可体验。该模型支持100万token超长上下文,单次最大输出38.4万token,基准测试较Preview全面提升,落地场景具差异化优势。
贾樟柯编剧新片《敦煌妈妈》备案立项,讲述敦煌独居母亲借助AI排解寂寞、了解外界,最终完成横穿中国之旅。主演赵涛、廖凡,预计2027年上映。
OpenAI正加速推进今年在美上市,估值有望突破万亿美元。内部文件显示,其年化营收已突破400亿美元,较去年底翻倍增长;7月单月营收环比增长超20%,财务表现亮眼,引发资本市场高度聚焦。

关注 “悠AI” 更多干货技巧行业动态