观点

罗福莉压力有多大?都给小米模型训练整上直播了

文 | 字母AI

太刺激了。都知道模型训练很费钱,可亲眼看着小米“直播”里的金额往上跳,还是有点替它肉疼。

北京时间9月15日晚,小米两款新模型先后启动了这一轮训练。到17日下午,还不到两天,页面上的累计成本已经超过130万美元,而且还在涨。好在这笔钱不用观众掏,不然看着看着,可能真得关掉网页缓一缓。

 罗福莉压力有多大?都给小米模型训练整上直播了

把围观地址发出来的,是小米大模型负责人、前DeepSeek研究员罗福莉。

当天凌晨,她在X上写道:“沉寂了近半年。”随后解释,这段时间她和团队一直在研究,强化学习究竟能扩展到什么程度。

 罗福莉压力有多大?都给小米模型训练整上直播了

新模型MiMo-V2.6还没练完,罗福莉就先开“直播”给大家看,不得不说蛮有魄力的。

不过,钱花得快肯定不是这个“直播”透露的唯一信息。罗福莉过去几个月忙些什么,小米又能靠这轮训练往前追赶多少才是更关键的。

模型还没练完,先开直播了

“直播”页面不难看懂,MiMo-V2.6的Pro和Flash两款模型各占一栏。

截至北京时间9月17日15时47分,Pro这轮训练跑了45个多小时,累计花费约93万美元。晚几个小时开练的Flash跑了约40个半小时,花费约41.6万美元。Pro花的钱已经是Flash的两倍多。

 罗福莉压力有多大?都给小米模型训练整上直播了

进度上,Pro完成了第14步,正在进行第15步。Flash完成了第17步,正在进行第18步。Flash看着跑得更快,但光比步数,还不能判断谁练得更好,得看看下面的测试成绩。

页面公布了一项名叫DeepSWE v1.1的软件开发测试。它会让模型在真实的开源项目里增加功能、修复问题,再检查交上来的代码是否符合要求。新功能做出来了,却把原有功能改坏了也不算通过。

目前页面公布的通过率,Pro为65.78%,Flash为60.77%。也就是说,在这项测试里,两款模型都能完成六成多的任务,Pro领先约5个百分点。这些成绩会随着阶段性测试完成而更新,模型还在训练,现在看到的只是中途测验的成绩。

 罗福莉压力有多大?都给小米模型训练整上直播了

更有意思的是,网页还兼任故障通报栏,小米连训练时出了什么岔子也写在了页面上。

页面顶部的公告写着,Pro因为一个计算节点出现显存问题,需要重启。Flash则在一组数据上遇到了某类基础设施错误,约3小时内没能正确识别,最后从第15步重新启动。

 罗福莉压力有多大?都给小米模型训练整上直播了

平时看模型发布,大家拿到的是一份已经整理好的成绩单,训练中出了什么问题、重来了几次,通常没机会了解。这次小米连故障通知也挂了出来,外界可以直观看到当模型的分数在往上涨的同时,团队也还在忙着排查问题、重启训练。简直是一场行为艺术。

这种“直播”很快就吸引到了同行关注。

Meta研究员、前OpenAI研究员卢卡斯·拜尔看到罗福莉介绍扩大训练规模的三个方向,忍不住替她重新“翻译”了一遍:算力、算力,还是算力。玩笑开完,他又特意称赞,小米竟然连“目前花了多少钱”都公开了。

 罗福莉压力有多大?都给小米模型训练整上直播了

加州大学圣迭戈分校副教授、强化学习研究者Yu-Xiang Wang也说,自己“看得移不开眼”,还专门提了个要求,希望团队把训练过程中遇到的各种问题记录下来。前面那些重启公告,恰好也是他想了解的内容。

 罗福莉压力有多大?都给小米模型训练整上直播了

曾任康奈尔大学教授、参与过Cursor模型研发的Sasha Rush,也拿着手机盯起了直播。他自嘲,看一项编程任务的响应长度,看出了赌徒上头的感觉,随后又对数字的变化犯起嘀咕:“从80k跳到120k,这个幅度感觉太大了。”

公开到这个程度,外界已经可以拿着具体细节讨论训练方法了。

说起来,小米今年3月还让新模型玩过一次“猜猜我是谁”。当时,一个叫Hunter Alpha的匿名模型出现在模型服务平台OpenRouter上。一周后,小米才在3月18日揭晓身份:这是MiMo-V2-Pro的早期测试版。

到了这次,罗福莉干脆提前把训练过程公开,还预告未来几周会逐步开源相关细节。至于这场训练想解决什么问题,她在推文里表示过去近半年,团队一直在研究强化学习究竟能扩展到什么程度。

半年沉寂,罗福莉到底在忙什么?

今年4月,MiMo-V2.5系列发布并开源。同月上线的《张小珺Jùn|商业访谈录》中,罗福莉谈到,国内团队正在加快探索Agent的后训练,其中一个重点就是扩大强化学习的规模。主持人追问有没有初步结果,她当时只说:“暂时还不是很方便分享。”

几个月后,小米把训练过程放到了网上。模型每天花着这么多钱,到底在学什么?

拿修网站来说。用户发现网站突然登录不上,让AI处理,它就得找到相关文件,检查哪里出了问题,修改代码,再运行测试。有时候改完依然报错,还得继续排查。用户要的是能登录,光收到一句“已经为您修复”,显然不算交差。

这类能使用工具、连续处理任务的AI,就是我们经常听到的Agent。训练时,模型会反复尝试完成任务,系统根据它的表现打分,再用这些反馈调整模型参数,让有效的做法更容易在以后出现。这是强化学习在Agent训练中的一种用法。

按照罗福莉公布的配置,小米每个训练步骤安排1568条提示词,每条对应16次尝试,合计25088条轨迹。

 罗福莉压力有多大?都给小米模型训练整上直播了

这里的一条轨迹,是模型从接到任务到结束的完整过程。修网站时,即使中间改了好几次代码、跑了好几遍测试,也仍然属于同一次尝试。大量这样的过程累积起来,一个训练步骤就涉及约20亿token。模型读写的文字、代码等内容,都按这种单位计量。

所以,页面上一个不起眼的“step”,里面可能已经忙活了很久。

这些练习还有个准备工作:得让模型有地方操作。

比如修网站,训练系统要提供项目文件和运行代码的工具。模型代码修改以后,程序能不能正常运行,也得把结果反馈给它。只有一句“请修复登录故障”,却没有文件可查、没有程序可运行,它也无从下手。

罗福莉在访谈中提到,团队会先让公司内部更多人使用模型,从中发现实际需求,再围绕这些场景构造训练数据。难的是,还得尽量还原使用时的环境,让模型可以在里面连续操作,并设置相应的评分标准。

这次MiMo-V2.6扩大的训练环境和执行框架,就涉及这些工作。同一次训练可以混合多类任务,模型面对的工具、操作过程和完成要求也会有所不同。

而且,模型做得好不好,也需要花算力去判断。任务复杂了,检查作业也跟着费事。

程序能不能通过测试,可以交给系统运行检查。换成让AI分析一家公司的经营情况,就得核对数据和结论。比如它把去年的营收当成今年的,后面写得再有道理,分析也站不住脚。评分系统需要能识别这些问题,否则给错了奖励,模型还可能继续照着错误的做法学。

这也是罗福莉把“评分算力”单独列出来的原因。模型尝试完成任务要花算力,判断这些尝试做得怎么样,同样要投入计算资源。

目前,编程在这场训练中占了相当大的分量。北京时间9月17日17时49分,Pro第14步的代码类提示词占67.7%,超过三分之二,此外还混合了视觉、聊天等任务。

 罗福莉压力有多大?都给小米模型训练整上直播了

为什么要让模型写这么多代码?罗福莉给过一个解释:软件开发往往需要连续处理很多问题,围绕它形成的规划能力、上下文管理方法,也能帮助AI完成其他复杂任务。

比如一个项目改到一半,模型得记住已经改过哪些地方,哪些办法试过但没用。事情多了,还要整理和保留关键信息,方便后面接着做。这些要求放到资料研究等需要多步处理的工作里,同样存在。

当然,代码练好了,也不意味着其他工作就能直接上手。罗福莉同样强调,想让模型在更多场景里表现稳定,还得安排相应的训练。

小米这次想继续摸清的,就是这些投入能带来多大的进步:增加尝试、扩充任务环境、花更多算力判断结果,模型的能力还能往上走多远。直播里的成本在涨,接下来要看的,是模型学到的本事能不能跟着有长进。

三年600亿元,小米要拿出什么成绩?

今年4月,罗福莉谈到,下一步扩大哪些部分的训练规模、采用什么芯片,会影响半年、大半年之后谁更领先。几个月过去,小米选择在强化学习上继续投入,研究能带来多大进步,也逐渐到了看结果的时候。

从DeepSeek研究员到小米MiMo负责人,罗福莉做一个技术判断,牵动的事情也多了。一个方向值得尝试,接下来就得安排人手、分配算力,再根据实验结果决定要不要继续。方向如果选得不好,花掉的还有整个团队的时间。

 罗福莉压力有多大?都给小米模型训练整上直播了

她在访谈中提到,训练MiMo-V2-Pro和Flash,各自需要几千张计算卡,但做研究需要的卡还要更多。正式训练之前,团队得先验证各种想法。最后没被采用的方案,也不会因此免单。

所以,直播里两款模型不断上涨的成本,只是外界能看到的一部分。罗福莉还得考虑眼前这款模型继续打磨的同时,给下一代留出多少研究资源。

小米对AI的期待,也早已超出发布几款模型。

今年3月19日,小米创始人雷军宣布,未来三年将在AI领域至少投入600亿元。这笔钱覆盖整个AI业务,并非全部交给MiMo训练模型,这足以说明,小米希望AI在公司里承担多大的作用。

 罗福莉压力有多大?都给小米模型训练整上直播了

这种期待已经体现在业务安排上。7月,36氪援引知情人士消息称,小米调整了小爱同学的组织架构:罗福莉带领的MiMo团队提供基础模型能力,另外的团队负责云端工程建设,手机、汽车等业务的OS团队则负责各自的端侧能力。

按照这个分工,MiMo往前走一步,后面还有不同的产品团队等着将之融入业务。小米有现成的设备和用户,确实省去了从零寻找应用场景的麻烦。可场景越多,对模型的要求也越复杂。

编程测试里表现不错,不代表放进手机、汽车和智能家居之后,就能让用户放心交代事情。比如用户让AI改一项设置,它得弄清楚说的是哪个设备,能操作到什么程度,遇到含糊的要求还得确认。一次演示可以挑最顺利的过程,卖出去的产品却每天都会碰上各种意料之外的用法。

这些问题当然不可能都由罗福莉一个团队解决,但模型能做到哪一步,会影响后面的产品能往前走多远。小米投入600亿元之后,用户最终感受到的仍然得是手机和其他设备到底好用了多少。

与此同时,模型同行也不会因为小米要照顾这么多业务,就更新得慢一些。

9月10日,DeepSeek发布V4.1-Flash,把更大规模的强化学习列为提升能力的办法之一,同时强调降低运行成本。小米正在研究的方向,同行也在投入,而且成果已经放出来供开发者使用。

这也是模型竞争让负责人头疼的地方。MiMo-V2.6相对上一代进步多少,和它能让多少开发者改用小米,是两个问题。

小米自己也已经走到了让用户掏钱选择的阶段。今年6月推出的AI编程助手MiMo Code,在7月26日结束了免费使用阶段,用户可以订阅小米的Token Plan继续使用。

免费时觉得值得试试,付费后还愿不愿意继续用,要求自然不一样。

罗福莉带领的团队已经让MiMo获得了关注,接下来还得让这种关注经得起几轮更新。V2.6的完整评测和实际使用表现,会是下一次检验。

*如果大家有关于中泰信托吴庆斌、建华建材、深圳优制云工业互联网有限公司郑能欢、镇江市中级人民法院贾黛舒、句容市人民法院赵剑岚、南京市鼓楼人民法院刘桂占的相关新闻线索,欢迎联系我们,我们将联合其他媒体进行全球范围的重点报道。
外卖“御三家”:狂热开始,理性收敛
« 上一篇 09-18
月之暗面递表之后,Kimi 的成色要被验算三遍
下一篇 » 09-18

相关内容

苹果入场,国产折叠屏还能笑多久?
固态电池未来3年的剧本大抵是这样的
Anthropic之恶
从谷歌到字节,每个大厂,终将拥有一家药厂