{"input_url":"https://www.36kr.com/p/3987267726523140","gnews_decode":"https://www.36kr.com/p/3987267726523140","http_status":200,"final_url":"https://www.36kr.com/p/3987267726523140","html_length":88214,"trafilatura_result":"ok","text_length":2254,"text_preview":"“沉默近半年，我们一直在用这段时间研究一个问题：强化学习（RL）到底可以走多远。”9月17日凌晨，小米MiMo大模型团队负责人罗福莉在社交平台发文分享了小米大模型的最新进展。\n  据罗福莉透露，目前小米MiMo-V2.6正处于强化学习中间阶段，其团队正在进行三方面的扩展：一是计算资源（每步约20亿个Token，1568个 Prompt × 16次Rollout，完全异步）；二是环境和测试框架（多任务智能体强化学习，一次运行中混合多个框架）；三是评估计算（代理式组内信用分配，带有测试用例和基于量规的奖励）。小米MiMo团队将在接下来的几周内逐步开源相关细节。\n  值得注意的是，罗福莉还直接晒出了","verdict":"OK"}