{"id":79231,"topic":"ai","source":"新浪网","title":"大模型全是演技派！AI教学的正确方式：用真实数据训出60个数字学生|数学题|作文|教师|模拟器|训练_手机新浪网 - 新浪网","url":"https://finance.sina.cn/stock/jdts/2026-09-10/detail-inirihny3018910.d.html?vt=4&cid=76993&node_id=76993","url_hash":"e5ad6b00e28ce5fde0d088f339b7983c17ea8568","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMipwFBVV95cUxNVl9nTzl6ODg4YU43SFZsdXNiQkFRYW5wOVZyYUFnZWhZQnNoUnJyZWFZYlM1NjVucEVfVVBJVmdmMWRzYUZyeGZ1WXgzekdzUlRZdFkwSmdJLTM4enJHSFJnSUpqVDVFV0NGNEdkZUNEc1RJdmdXel9hTUoxRHBocjg4S0xjYkU2NDVLR0NzSnlfWW8tRFZYQ2xoWU10bktiWnNsOU1HQQ?oc=5\" target=\"_blank\">大模型全是演技派！AI教学的正确方式：用真实数据训出60个数字学生|数学题|作文|教师|模拟器|训练_手机新浪网</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">新浪网</font>","content":"大模型全是演技派！AI教学的正确方式：用真实数据训出60个数字学生\n（来源：新智元）\n新智元报道\nAI教师已经可以完成不少单次教学任务。\n一道数学题，它能拆解步骤；一篇英文作文，它能指出语法问题；一盘棋，它也能讲出下一步思路。很多场景里，模型输出已经足够像一位耐心助教。\n但教学效果不能只看教师端。学生听完之后有没有改正错误，是否只是照着提示走，同一句讲解对不同学生是否产生不同效果，这些都发生在学生端。\nAI教师如果要学习个性化指导，也需要反复观察学生反应。\n现实里，这些反应主要来自human study。每次调整教学策略，都要组织学生参与，收集交互，再由人工评估。\nAI模型可以快速更新，但教育反馈的获取速度受human study实验周期限制。\nAI tutor需要学生反馈来改进教学，但真实反馈采集成本较高。StudentSim希望把真实学生记录转化为训练阶段可反复调用的代理反馈。\n近期研究StudentSim，从这个矛盾出发。\n研究团队希望提升AI教师，使其理解学生优劣势，并根据不同学生给出合适指导。推进过程中，团队把问题落到学生模拟器上：能否用真实学生数据训练出可评估、可复用的AI学生，让AI教师在训练阶段获得更多反馈。\n论文链接： https://arxiv.org/abs/2609.01591\n代码链接：https://github.com/microsoft/StudentSim\nHuggingface Paper主页：https://huggingface.co/papers/2609.01591\n这件事放在今天的AI agent研究里并不孤立。User simulator正在成为热门的研究方向，进入客服、电商、医疗问诊、网页操作等场景。研究者会构造模拟用户，让agent在上线前经历更多交互，测试策略、话术和鲁棒性。\n教育场景里的用户模拟更复杂。学生有相对稳定的知识边界、错误习惯和学习轨迹。同一道题，有人会算错符号，有人会误解概念，有人听完提示后可以自己推到答案，有人需要更直接的指导。\n近来被讨论的人类学生数字孪生，也正是围绕这类需求展开。\n建模学生并不是新题目\n从1995年的贝叶斯知识追踪，到深度知识追踪、再到注意力知识追踪，这条方向已经被前人探索了近30年，在拟合学生行为上相当成熟。\n它们的共同缺口在于，模型只接受题目、状态、能力值这类结构化输入，没有一个接收自然语言指导的入口。无论教师说了什么，这类模型无法交互作出像学生一样的表现改变。\n如果直接让大模型扮演学生，看起来很方便。给它写一句「你是一个数学基础薄弱的小学生」，模型可以立刻换成低龄学生口吻，也能表现出犹豫和不确定。\n可是，角色语气和认知水平并不同步。\n一个模型可以用小学生口吻回答「我不太懂」，下一句却给出微积分级别的推理。它看起来在扮演学生，实际反馈仍然受模型自身知识储备影响，可能远远高于它被限制拥有的知识水平。\n用于AI教师训练时，这种认知水平偏差会带来问题。Tutor得到的不是某个学生在当前能力边界下的反应，而是一个高能力模型经过人设包装后的反应。\n也正是因为这样，仅靠一段能力描述做条件，对大模型来说，是一条很脆弱的条件通道。这条路线近两年被大量套用到教育场景，对话辅导语料、多智能体课堂、学习者数据生成都在用；与此同时，一批专门检验其效度的研究也在出现，从架构、保真度基准、教师使用体验三个角度提出质疑。\n教育学中，评价一次指导是否有效，通常不能只看学生独立作答时的表现，也要看学生在接受帮助后能走多远。\nVygotsky提出的最近发展区（zone of proximal development）讨论的就是这件事：学生当前能独立完成什么，和在教师支持下能够完成什么，中间的差距反映了教学可以介入的空间。\n这一想法后来被动态评估（dynamic assessment）落为可操作的测量程序：不只记录学生答对与否，还要在给出提示后观察他的表现如何移动。\n放到学生模拟器上，这个思想对应两类能力。\n第一，模拟器要能复现学生独立作答时的状态，包括能力边界、错误习惯和常见选择。第二，模拟器要能在读到教师指导后产生相应变化，表现出这个学生在帮助下可能出现的更新。\nStudentSim\nStudentSim把这两类能力分别定义为behavioral fidelity和guidance responsiveness，并据此训练和评估个性化学生模拟器。\n学生模拟器需要同时回答两个问题：独立作答时是否像目标学生，接受教师指导后是否产生相应变化。\n训练流程分为两步。\n第一步汇总一个领域内多名学生记录，训练通用学生行为模型。这个阶段学习共性错误、回答格式、指导后的修正路径。\n第二步使用单个学生自己的记录继续训练，得到个性化模拟器。单名学生记录少，直接训练容易过拟合；先学习群体规律，再适配个人数据，可以更稳定地获得每位学生对应的模拟器。\n训练流程\n研究团队同时构建StudentSimEval。评估覆盖60位真实学生，来自国际象棋、第二语言英语写作和基础数学三个场景。\n国际象棋中，模拟器要预测某位玩家在棋局中的走法，并在教练指导后改走位。二语写作中，模拟器要生成符合学习者错误模式的作文，并根据教师批改改写片段。数学中，模拟器要预测学生答案，并在讲解后修正。\n这些任务表面差异很大，评估目标保持一致：先看模拟器是否像学生本人，再看它能否响应指导。所有方法拿到同一份学生记录，在相同held-out测试记录上比较。\n国际象棋结果中，StudentSim的F为0.5150，R为0.9067；GPT-5.4分别为0.2316和0.7186；Maia2分别为0.4535和0.2721。二语写作和数学实验中，StudentSim也在两个指标上超过对应基线。\n国际象棋评测中的二维结果。GPT-5.4响应指导较好，但行为保真较低；Maia2更贴近棋手走法，但缺少自然语言指导入口；StudentSim位于两项指标同时较高的位置。\n这组结果呈现出清晰分工。GPT-5.4能阅读指导，模拟具体学生时保真不足。Maia2更贴近人类棋手走法，无法吸收自然语言教练提示。StudentSim通过真实学习记录训练，并对每位学生进行适配，在个体行为和指导响应两方面同时获得提升。\n不过学生模拟器本身不是目的，终点是，它的功用需要能落地到现实世界，能被用来改进教师模型。\n以往训练AI tutor，奖励信号在一些工作中来自专家标注的优质辅导对话，另外一些来自使用评分量表的通用大模型裁判。也有工作尝试把奖励接到模拟学生上，但采用的都是认知水平并不保真的角色扮演的LLM学生，而不是在真实学习者数据上训练过的模拟器。StudentSim在这一点上提出了不同的做法。\n论文进一步把StudentSim放入AItutor强化学习流程。\n实验场景为国际象棋。系统先取出真实学生犯过的错误走法，AI tutor生成指导，StudentSim读完指导后给出修正走法。\nStockfish用于计算修正走法相对原错误走法的质量变化，这个分数回传给tutor作为RL信号。对照组包括无RL的tutor，以及使用GPT-5.4作为学生模拟器reward的tutor。\nTutor生成指导，冻结的AI学生模拟器给出修正答案，系统根据修正前后的质量变化更新tutor。\n三组tutor使用相同基础模型、SFT起点和GRPO设置，reward来源不同。\n国际象棋评估者进行盲评后，StudentSim reward训练出的tutor在准确性、指导质量和个性化评分上均排在第一。\n专家在打乱呈现顺序的条件下盲评三个维度：准确性看「没有误导性事实错误」的回答占比，指导质量和个性化各为1到5分。StudentSim reward训练出的tutor在三个维度上均排第一。\n更值得注意的是结果反向的一组实验：用GPT-5.4当学生模拟器训出来的tutor，准确性不仅输给StudentSim，还低于完全没做RL的基线，拖后腿的是明显更高的严重事实错误率。模拟器不保真，会把教师往错的方向推：一个认知水平不符合真实学生、但理解能力超强的模拟器，读完再离谱的指导也能自己推出某种答案，于是给错误指导发了随机奖励，RL就朝着混乱（甚至错误）的方向优化。\nStudentSim没有把真实学生实验从教育研究中取代。它把真实学生记录转化成训练阶段可反复调用的模拟反馈，使AI tutor在进入human study前完成更多轮筛选和优化。\n对于需要个性化反馈的AI教师系统，这类学生模拟器、延续着近期热门的用户模拟器的思想脉络（一切人都可以模拟，建造人类的数字孪生），提供了一条颠覆性的工程路径：\n学习学生如何出错，学习学生如何在指导下改变，为教师模型的强化学习提供机器学习时间尺度的反馈信号。\n参考资料：\nhttps://arxiv.org/abs/2609.01591\n编辑：LRST","image_url":"https://n.sinaimg.cn/spider20260910/227/w654h373/20260910/1b3f-1590e4e93b479fd17af90cfbc8fc115c.jpg","lang":"zh","published_at":"2026-09-10T06:11:15+00:00","fetched_at":"2026-09-10T07:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"大模型全是演技派！AI教学的正确方式：用真实数据训出60个数字学生\n（来源：新智元）\n新智元报道\nAI教师已经可以完成不少单次教学任务。\n一道数学题，它能拆解步骤；一篇英文作文，它能指出语法问题；一盘棋，它也能讲出下一步思路。很多场景里，模型输出已经足够像一位耐心助教。\n但教学效果不能只看教师端。学生听完之后有没有改正错误，是否只是照着提示走，同一句讲解对不同学生是否产生不同效果，这些都发生在学生端。\nAI教师如果要学习个性化指导，也需要反复观察学生反应。\n现实里，这些反应主要来自human study。每次调整教学策略，都要组织学生参与，收集交互，再由人工评估。\nAI模型可以快速更新，但教育反馈的获取速度受human study实验周期限制。\nAI tutor需要学生反馈来改进教学，但真实反馈采集成本较高。StudentSim希望把真实学生记录转化为训练阶段可反复调用的代理反馈。\n近期研究StudentSim，从这个矛盾出发。\n研究团队希望提升AI教师，使其理解学生优劣势，并根据不同学生给出合适指导。推进过程中，团队把问题落到学生模拟器上：能否用真实学生数据训练出可评估、可复用的AI学生，让AI教师在训练阶段获得更多反馈。\n论文链接： https://arxiv.org/abs/2609.01591\n代码链接：https://github.com/microsoft/StudentSim\nHuggingface Paper主页：https://huggingface.co/papers/2609.01591\n这件事放在今天的AI agent研究里并不孤立。User simulator正在成为热门的研究方向，进入客服、电商、医疗问诊、网页操作等场景。研究者会构造模拟用户，让agent在上线前经历更多交互，测试策略、话术和鲁棒性。\n教育场景里的用户模拟更复杂。学生有相对稳定的知识边界、错误习惯和学习轨迹。同一道题，有人会算错符号，有人会误解概念，有人听完提示后可以自己推到答案，有人需要更直接的指导。\n近来被讨论的人类学生数字孪生，也正是围绕这类需求展开。\n建模学生并不是新题目\n从1995年的贝叶斯知识追踪，到深度知识追踪、再到注意力知识追踪，这条方向已经被前人探索了近30年，在拟合学生行为上相当成熟。\n它们的共同缺口在于，模型只接受题目、状态、能力值这类结构化输入，没有一个接收自然语言指导的入口。无论教师说了什么，这类模型无法交互作出像学生一样的表现改变。\n如果直接让大模型扮演学生，看起来很方便。给它写一句「你是一个数学基础薄弱的小学生」，模型可以立刻换成低龄学生口吻，也能表现出犹豫和不确定。\n可是，角色语气和认知水平并不同步。\n一个模型可以用小学生口吻回答「我不太懂」，下一句却给出微积分级别的推理。它看起来在扮演学生，实际反馈仍然受模型自身知识储备影响，可能远远高于它被限制拥有的知识水平。\n用于AI教师训练时，这种认知水平偏差会带来问题。Tutor得到的不是某个学生在当前能力边界下的反应，而是一个高能力模型经过人设包装后的反应。\n也正是因为这样，仅靠一段能力描述做条件，对大模型来说，是一条很脆弱的条件通道。这条路线近两年被大量套用到教育场景，对话辅导语料、多智能体课堂、学习者数据生成都在用；与此同时，一批专门检验其效度的研究也在出现，从架构、保真度基准、教师使用体验三个角度提出质疑。\n教育学中，评价一次指导是否有效，通常不能只看学生独立作答时的表现，也要看学生在接受帮助后能走多远。\nVygotsky提出的最近发展区（zone of proximal development）讨论的就是这件事：学生当前能独立完成什么，和在教师支持下能够完成什么，中间的差距反映了教学可以介入的空间。\n这一想法后来被动态评估（dynamic assessment）落为可操作的测量程序：不只记录学生答对与否，还要在给出提示后观察他的表现如何移动。\n放到学生模拟器上，这个思想对应两类能力。\n第一，模拟器要能复现学生独立作答时的状态，包括能力边界、错误习惯和常见选择。第二，模拟器要能在读到教师指导后产生相应变化，表现出这个学生在帮助下可能出现的更新。\nStudentSim\nStudentSim把这两类能力分别定义为behavioral fidelity和guidance responsiveness，并据此训练和评估个性化学生模拟器。\n学生模拟器需要同时回答两个问题：独立作答时是否像目标学生，接受教师指导后是否产生相应变化。\n训练流程分为两步。\n第一步汇总一个领域内多名学生记录，训练通用学生行为模型。这个阶段学习共性错误、回答格式、指导后的修正路径。\n第二步使用单个学生自己的记录继续训练，得到个性化模拟器。单名学生记录少，直接训练容易过拟合；先学习群体规律，再适配个人数据，可以更稳定地获得每位学生对应的模拟器。\n训练流程\n研究团队同时构建StudentSimEval。评估覆盖60位真实学生，来自国际象棋、第二语言英语写作和基础数学三个场景。\n国际象棋中，模拟器要预测某位玩家在棋局中的走法，并在教练指导后改走位。二语写作中，模拟器要生成符合学习者错误模式的作文，并根据教师批改改写片段。数学中，模拟器要预测学生答案，并在讲解后修正。\n这些任务表面差异很大，评估目标保持一致：先看模拟器是否像学生本人，再看它能否响应指导。所有方法拿到同一份学生记录，在相同held-out测试记录上比较。\n国际象棋结果中，StudentSim的F为0.5150，R为0.9067；GPT-5.4分别为0.2316和0.7186；Maia2分别为0.4535和0.2721。二语写作和数学实验中，StudentSim也在两个指标上超过对应基线。\n国际象棋评测中的二维结果。GPT-5.4响应指导较好，但行为保真较低；Maia2更贴近棋手走法，但缺少自然语言指导入口；StudentSim位于两项指标同时较高的位置。\n这组结果呈现出清晰分工。GPT-5.4能阅读指导，模拟具体学生时保真不足。Maia2更贴近人类棋手走法，无法吸收自然语言教练提示。StudentSim通过真实学习记录训练，并对每位学生进行适配，在个体行为和指导响应两方面同时获得提升。\n不过学生模拟器本身不是目的，终点是，它的功用需要能落地到现实世界，能被用来改进教师模型。\n以往训练AI tutor，奖励信号在一些工作中来自专家标注的优质辅导对话，另外一些来自使用评分量表的通用大模型裁判。也有工作尝试把奖励接到模拟学生上，但采用的都是认知水平并不保真的角色扮演的LLM学生，而不是在真实学习者数据上训练过的模拟器。StudentSim在这一点上提出了不同的做法。\n论文进一步把StudentSim放入AItutor强化学习流程。\n实验场景为国际象棋。系统先取出真实学生犯过的错误走法，AI tutor生成指导，StudentSim读完指导后给出修正走法。\nStockfish用于计算修正走法相对原错误走法的质量变化，这个分数回传给tutor作为RL信号。对照组包括无RL的tutor，以及使用GPT-5.4作为学生模拟器reward的tutor。\nTutor生成指导，冻结的AI学生模拟器给出修正答案，系统根据修正前后的质量变化更新tutor。\n三组tutor使用相同基础模型、SFT起点和GRPO设置，reward来源不同。\n国际象棋评估者进行盲评后，StudentSim reward训练出的tutor在准确性、指导质量和个性化评分上均排在第一。\n专家在打乱呈现顺序的条件下盲评三个维度：准确性看「没有误导性事实错误」的回答占比，指导质量和个性化各为1到5分。StudentSim reward训练出的tutor在三个维度上均排第一。\n更值得注意的是结果反向的一组实验：用GPT-5.4当学生模拟器训出来的tutor，准确性不仅输给StudentSim，还低于完全没做RL的基线，拖后腿的是明显更高的严重事实错误率。模拟器不保真，会把教师往错的方向推：一个认知水平不符合真实学生、但理解能力超强的模拟器，读完再离谱的指导也能自己推出某种答案，于是给错误指导发了随机奖励，RL就朝着混乱（甚至错误）的方向优化。\nStudentSim没有把真实学生实验从教育研究中取代。它把真实学生记录转化成训练阶段可反复调用的模拟反馈，使AI tutor在进入human study前完成更多轮筛选和优化。\n对于需要个性化反馈的AI教师系统，这类学生模拟器、延续着近期热门的用户模拟器的思想脉络（一切人都可以模拟，建造人类的数字孪生），提供了一条颠覆性的工程路径：\n学习学生如何出错，学习学生如何在指导下改变，为教师模型的强化学习提供机器学习时间尺度的反馈信号。\n参考资料：\nhttps://arxiv.org/abs/2609.01591\n编辑：LRST","cluster_id":3510347,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://finance.sina.cn/stock/jdts/2026-09-10/detail-inirihny3018910.d.html?vt=4&cid=76993&node_id=76993","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3670 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3670,"summary_length":3670,"usable_text_length":3670,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3670,"summary_length":3670}},"news_item":{"id":79231,"canonical_url":"https://finance.sina.cn/stock/jdts/2026-09-10/detail-inirihny3018910.d.html?vt=4&cid=76993&node_id=76993","source_url":"https://finance.sina.cn/stock/jdts/2026-09-10/detail-inirihny3018910.d.html?vt=4&cid=76993&node_id=76993","title":"大模型全是演技派！AI教学的正确方式：用真实数据训出60个数字学生|数学题|作文|教师|模拟器|训练_手机新浪网 - 新浪网","source_name":"新浪网","author":null,"published_at":"2026-09-10T06:11:15+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMipwFBVV95cUxNVl9nTzl6ODg4YU43SFZsdXNiQkFRYW5wOVZyYUFnZWhZQnNoUnJyZWFZYlM1NjVucEVfVVBJVmdmMWRzYUZyeGZ1WXgzekdzUlRZdFkwSmdJLTM4enJHSFJnSUpqVDVFV0NGNEdkZUNEc1RJdmdXel9hTUoxRHBocjg4S0xjYkU2NDVLR0NzSnlfWW8tRFZYQ2xoWU10bktiWnNsOU1HQQ?oc=5\" target=\"_blank\">大模型全是演技派！AI教学的正确方式：用真实数据训出60个数字学生|数学题|作文|教师|模拟器|训练_手机新浪网</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">新浪网</font>","full_text":"大模型全是演技派！AI教学的正确方式：用真实数据训出60个数字学生\n（来源：新智元）\n新智元报道\nAI教师已经可以完成不少单次教学任务。\n一道数学题，它能拆解步骤；一篇英文作文，它能指出语法问题；一盘棋，它也能讲出下一步思路。很多场景里，模型输出已经足够像一位耐心助教。\n但教学效果不能只看教师端。学生听完之后有没有改正错误，是否只是照着提示走，同一句讲解对不同学生是否产生不同效果，这些都发生在学生端。\nAI教师如果要学习个性化指导，也需要反复观察学生反应。\n现实里，这些反应主要来自human study。每次调整教学策略，都要组织学生参与，收集交互，再由人工评估。\nAI模型可以快速更新，但教育反馈的获取速度受human study实验周期限制。\nAI tutor需要学生反馈来改进教学，但真实反馈采集成本较高。StudentSim希望把真实学生记录转化为训练阶段可反复调用的代理反馈。\n近期研究StudentSim，从这个矛盾出发。\n研究团队希望提升AI教师，使其理解学生优劣势，并根据不同学生给出合适指导。推进过程中，团队把问题落到学生模拟器上：能否用真实学生数据训练出可评估、可复用的AI学生，让AI教师在训练阶段获得更多反馈。\n论文链接： https://arxiv.org/abs/2609.01591\n代码链接：https://github.com/microsoft/StudentSim\nHuggingface Paper主页：https://huggingface.co/papers/2609.01591\n这件事放在今天的AI agent研究里并不孤立。User simulator正在成为热门的研究方向，进入客服、电商、医疗问诊、网页操作等场景。研究者会构造模拟用户，让agent在上线前经历更多交互，测试策略、话术和鲁棒性。\n教育场景里的用户模拟更复杂。学生有相对稳定的知识边界、错误习惯和学习轨迹。同一道题，有人会算错符号，有人会误解概念，有人听完提示后可以自己推到答案，有人需要更直接的指导。\n近来被讨论的人类学生数字孪生，也正是围绕这类需求展开。\n建模学生并不是新题目\n从1995年的贝叶斯知识追踪，到深度知识追踪、再到注意力知识追踪，这条方向已经被前人探索了近30年，在拟合学生行为上相当成熟。\n它们的共同缺口在于，模型只接受题目、状态、能力值这类结构化输入，没有一个接收自然语言指导的入口。无论教师说了什么，这类模型无法交互作出像学生一样的表现改变。\n如果直接让大模型扮演学生，看起来很方便。给它写一句「你是一个数学基础薄弱的小学生」，模型可以立刻换成低龄学生口吻，也能表现出犹豫和不确定。\n可是，角色语气和认知水平并不同步。\n一个模型可以用小学生口吻回答「我不太懂」，下一句却给出微积分级别的推理。它看起来在扮演学生，实际反馈仍然受模型自身知识储备影响，可能远远高于它被限制拥有的知识水平。\n用于AI教师训练时，这种认知水平偏差会带来问题。Tutor得到的不是某个学生在当前能力边界下的反应，而是一个高能力模型经过人设包装后的反应。\n也正是因为这样，仅靠一段能力描述做条件，对大模型来说，是一条很脆弱的条件通道。这条路线近两年被大量套用到教育场景，对话辅导语料、多智能体课堂、学习者数据生成都在用；与此同时，一批专门检验其效度的研究也在出现，从架构、保真度基准、教师使用体验三个角度提出质疑。\n教育学中，评价一次指导是否有效，通常不能只看学生独立作答时的表现，也要看学生在接受帮助后能走多远。\nVygotsky提出的最近发展区（zone of proximal development）讨论的就是这件事：学生当前能独立完成什么，和在教师支持下能够完成什么，中间的差距反映了教学可以介入的空间。\n这一想法后来被动态评估（dynamic assessment）落为可操作的测量程序：不只记录学生答对与否，还要在给出提示后观察他的表现如何移动。\n放到学生模拟器上，这个思想对应两类能力。\n第一，模拟器要能复现学生独立作答时的状态，包括能力边界、错误习惯和常见选择。第二，模拟器要能在读到教师指导后产生相应变化，表现出这个学生在帮助下可能出现的更新。\nStudentSim\nStudentSim把这两类能力分别定义为behavioral fidelity和guidance responsiveness，并据此训练和评估个性化学生模拟器。\n学生模拟器需要同时回答两个问题：独立作答时是否像目标学生，接受教师指导后是否产生相应变化。\n训练流程分为两步。\n第一步汇总一个领域内多名学生记录，训练通用学生行为模型。这个阶段学习共性错误、回答格式、指导后的修正路径。\n第二步使用单个学生自己的记录继续训练，得到个性化模拟器。单名学生记录少，直接训练容易过拟合；先学习群体规律，再适配个人数据，可以更稳定地获得每位学生对应的模拟器。\n训练流程\n研究团队同时构建StudentSimEval。评估覆盖60位真实学生，来自国际象棋、第二语言英语写作和基础数学三个场景。\n国际象棋中，模拟器要预测某位玩家在棋局中的走法，并在教练指导后改走位。二语写作中，模拟器要生成符合学习者错误模式的作文，并根据教师批改改写片段。数学中，模拟器要预测学生答案，并在讲解后修正。\n这些任务表面差异很大，评估目标保持一致：先看模拟器是否像学生本人，再看它能否响应指导。所有方法拿到同一份学生记录，在相同held-out测试记录上比较。\n国际象棋结果中，StudentSim的F为0.5150，R为0.9067；GPT-5.4分别为0.2316和0.7186；Maia2分别为0.4535和0.2721。二语写作和数学实验中，StudentSim也在两个指标上超过对应基线。\n国际象棋评测中的二维结果。GPT-5.4响应指导较好，但行为保真较低；Maia2更贴近棋手走法，但缺少自然语言指导入口；StudentSim位于两项指标同时较高的位置。\n这组结果呈现出清晰分工。GPT-5.4能阅读指导，模拟具体学生时保真不足。Maia2更贴近人类棋手走法，无法吸收自然语言教练提示。StudentSim通过真实学习记录训练，并对每位学生进行适配，在个体行为和指导响应两方面同时获得提升。\n不过学生模拟器本身不是目的，终点是，它的功用需要能落地到现实世界，能被用来改进教师模型。\n以往训练AI tutor，奖励信号在一些工作中来自专家标注的优质辅导对话，另外一些来自使用评分量表的通用大模型裁判。也有工作尝试把奖励接到模拟学生上，但采用的都是认知水平并不保真的角色扮演的LLM学生，而不是在真实学习者数据上训练过的模拟器。StudentSim在这一点上提出了不同的做法。\n论文进一步把StudentSim放入AItutor强化学习流程。\n实验场景为国际象棋。系统先取出真实学生犯过的错误走法，AI tutor生成指导，StudentSim读完指导后给出修正走法。\nStockfish用于计算修正走法相对原错误走法的质量变化，这个分数回传给tutor作为RL信号。对照组包括无RL的tutor，以及使用GPT-5.4作为学生模拟器reward的tutor。\nTutor生成指导，冻结的AI学生模拟器给出修正答案，系统根据修正前后的质量变化更新tutor。\n三组tutor使用相同基础模型、SFT起点和GRPO设置，reward来源不同。\n国际象棋评估者进行盲评后，StudentSim reward训练出的tutor在准确性、指导质量和个性化评分上均排在第一。\n专家在打乱呈现顺序的条件下盲评三个维度：准确性看「没有误导性事实错误」的回答占比，指导质量和个性化各为1到5分。StudentSim reward训练出的tutor在三个维度上均排第一。\n更值得注意的是结果反向的一组实验：用GPT-5.4当学生模拟器训出来的tutor，准确性不仅输给StudentSim，还低于完全没做RL的基线，拖后腿的是明显更高的严重事实错误率。模拟器不保真，会把教师往错的方向推：一个认知水平不符合真实学生、但理解能力超强的模拟器，读完再离谱的指导也能自己推出某种答案，于是给错误指导发了随机奖励，RL就朝着混乱（甚至错误）的方向优化。\nStudentSim没有把真实学生实验从教育研究中取代。它把真实学生记录转化成训练阶段可反复调用的模拟反馈，使AI tutor在进入human study前完成更多轮筛选和优化。\n对于需要个性化反馈的AI教师系统，这类学生模拟器、延续着近期热门的用户模拟器的思想脉络（一切人都可以模拟，建造人类的数字孪生），提供了一条颠覆性的工程路径：\n学习学生如何出错，学习学生如何在指导下改变，为教师模型的强化学习提供机器学习时间尺度的反馈信号。\n参考资料：\nhttps://arxiv.org/abs/2609.01591\n编辑：LRST","excerpt":"大模型全是演技派！AI教学的正确方式：用真实数据训出60个数字学生\n（来源：新智元）\n新智元报道\nAI教师已经可以完成不少单次教学任务。\n一道数学题，它能拆解步骤；一篇英文作文，它能指出语法问题；一盘棋，它也能讲出下一步思路。很多场景里，模型输出已经足够像一位耐心助教。\n但教学效果不能只看教师端。学生听完之后有没有改正错误，是否只是照着提示走，同一句讲解对不同学生是否产生不同效果，这些都发生在学生端。\nAI教师如果要学习个性化指导，也需要反复观察学生反应。\n现实里，这些反应主要来自human study。每次调整教学策略，都要组织学生参与，收集交互，再由人工评估。\nAI模型可以快速更新，但教育反馈的获取速度受human study实验周期限制。\nAI tutor需要学生反馈来改进教学，但真实反馈采集成本较高。StudentSim希望把真实学生记录转化为训练阶段可反复调用的代理反馈。\n近期研究StudentSim，从这个矛盾出发。\n研究团队希望提升AI教师，使其理解学生优劣势，并根据不同学生给出合适指导。推进过程中，团队把问题落到学生模拟器上：能否用真实学生数据训练出可评估、可复用的AI学生，让AI教师在训练阶段获得更多反馈。\n论文链接： https://arxiv.org/abs/2609.01591\n代码链接：https://github.com/microsoft/StudentSim\nHuggingface Paper主页：https://huggingface.co/papers/2609.01591\n这件事放在今天的AI agent研究里并不孤立。User simulator正在成为热门的研究方向，进入客服、电商、医疗问诊、网页操作等场景。研究者会构造模拟用户，让agent在上线前经历更多交互，测试策略、话术和鲁棒性。\n教育场景里的用户模拟更复杂。学生有相对稳定的知识边界、错误习惯和学习轨迹。同一道题，有人会算错符号，有人会误解概念，有人听完提示后可以自己推到答案，有人需要更直接的指导。\n近来被讨论的人类学生数字孪生，也正是围绕这类需求展开。\n建模学生并不是新题目\n从1995年的贝叶斯知识追踪，到深度知识追踪、再到注意力知识追踪，这条方向已经被前人探索了近30年，在拟合学生行为上相当成熟。\n它们的共同缺口在于，模型只接受题目、状态、能力值这类结构化输入，没有一个接收自然语言指导的入口。无论教师说了什么，这类模型无法交互作出像学生一样的表现改变。\n如果直接让大模型扮演学生，看起来很方便。给它写一句「你是一个数学基础薄弱的小学生」，模型可以立刻换成低龄学生口吻，也能表现出犹豫和不确定。\n可是，角色语气和认知水平并不同步。\n一个模型可以用小学生口吻回答「我不太懂」，下一句却给出微积分级别的推理。它看起来在扮演学生，实际反馈仍然受模型自身知识储备影响，可能远远高于它被限制拥有的知识水平。\n用于AI教师训练时，这种认知水平偏差会带来问题。Tutor得到的不是某个学生在当前能力边界下的反应，而是一个高能力模型经过人设包装后的反应。\n也正是因为这样，仅靠一段能力描述做条件，对大模型来说，是一条很脆弱的条件通道。这条路线近两年被大量套用到教育场景，对话辅导语料、多智能体课堂、学习者数据生成都在用；与此同时，一批专门检验其效度的研究也在出现，从架构、保真度基准、教师使用体验三个角度提出质疑。\n教育学中，评价一次指导是否有效，通常不能只看学生独立作答时的表现，也要看学生在接受帮助后能走多远。\nVygotsky提出的最近发展区（zone of proximal development）讨论的就是这件事：学生当前能独立完成什么，和在教师支持下能够完成什么，中间的差距反映了教学可以介入的空间。\n这一想法后来被动态评估（dynamic assessment）落为可操作的测量程序：不只记录学生答对与否，还要在给出提示后观察他的表现如何移动。\n放到学生模拟器上，这个思想对应两类能力。\n第一，模拟器要能复现学生独立作答时的状态，包括能力边界、错误习惯和常见选择。第二，模拟器要能在读到教师指导后产生相应变化，表现出这个学生在帮助下可能出现的更新。\nStudentSim\nStudentSim把这两类能力分别定义为behavioral fidelity和guidance responsiveness，并据此训练和评估个性化学生模拟器。\n学生模拟器需要同时回答两个问题：独立作答时是否像目标学生，接受教师指导后是否产生相应变化。\n训练流程分为两步。\n第一步汇总一个领域内多名学生记录，训练通用学生行为模型。这个阶段学习共性错误、回答格式、指导后的修正路径。\n第二步使用单个学生自己的记录继续训练，得到个性化模拟器。单名学生记录少，直接训练容易过拟合；先学习群体规律，再适配个人数据，可以更稳定地获得每位学生对应的模拟器。\n训练流程\n研究团队同时构建StudentSimEval。评估覆盖60位真实学生，来自国际象棋、第二语言英语写作和基础数学三个场景。\n国际象棋中，模拟器要预测某位玩家在棋局中的走法，并在教练指导后改走位。二语写作中，模拟器要生成符合学习者错误模式的作文，并根据教师批改改写片段。数学中，模拟器要预测学生答案，并在讲解后修正。\n这些任务表面差异很大，评估目标保持一致：先看模拟器是否像学生本人，再看它能否响应指导。所有方法拿到同一份学生记录，在相同held-out测试记录上比较。\n国际象棋结果中，StudentSim的F为0.5150，R为0.9067；GPT-5.4分别为0.2316和0.7186；Maia2分别为0.4535和0.2721。二语写作和数学实验中，StudentSim也在两个指标上超过对应基线。\n国际象棋评测中的二维结果。GPT-5.4响应指导较好，但行为保真较低；Maia2更贴近棋手走法，但缺少自然语言指导入口；StudentSim位于两项指标同时较高的位置。\n这组结果呈现出清晰分工。GPT-5.4能阅读指导，模拟具体学生时保真不足。Maia2更贴近人类棋手走法，无法吸收自然语言教练提示。StudentSim通过真实学习记录训练，并对每位学生进行适配，在个体行为和指导响应两方面同时获得提升。\n不过学生模拟器本身不是目的，终点是，它的功用需要能落地到现实世界，能被用来改进教师模型。\n以往训练AI tutor，奖励信号在一些工作中来自专家标注的优质辅导对话，另外一些来自使用评分量表的通用大模型裁判。也有工作尝试把奖励接到模拟学生上，但采用的都是认知水平并不保真的角色扮演的LLM学生，而不是在真实学习者数据上训练过的模拟器。StudentSim在这一点上提出了不同的做法。\n论文进一步把StudentSim放入AItutor强化学习流程。\n实验场景为国际象棋。系统先取出真实学生犯过的错误走法，AI tutor生成指导，StudentSim读完指导后给出修正走法。\nStockfish用于计算修正走法相对原错误走法的质量变化，这个分数回传给tutor作为RL信号。对照组包括无RL的tutor，以及使用GPT-5.4作为学生模拟器reward的tutor。\nTutor生成指导，冻结的AI学生模拟器给出修正答案，系统根据修正前后的质量变化更新tutor。\n三组tutor使用相同基础模型、SFT起点和GRPO设置，reward来源不同。\n国际象棋评估者进行盲评后，StudentSim reward训练出的tutor在准确性、指导质量和个性化评分上均排在第一。\n专家在打乱呈现顺序的条件下盲评三个维度：准确性看「没有误导性事实错误」的回答占比，指导质量和个性化各为1到5分。StudentSim reward训练出的tutor在三个维度上均排第一。\n更值得注意的是结果反向的一组实验：用GPT-5.4当学生模拟器训出来的tutor，准确性不仅输给StudentSim，还低于完全没做RL的基线，拖后腿的是明显更高的严重事实错误率。模拟器不保真，会把教师往错的方向推：一个认知水平不符合真实学生、但理解能力超强的模拟器，读完再离谱的指导也能自己推出某种答案，于是给错误指导发了随机奖励，RL就朝着混乱（甚至错误）的方向优化。\nStudentSim没有把真实学生实验从教育研究中取代。它把真实学生记录转化成训练阶段可反复调用的模拟反馈，使AI tutor在进入human study前完成更多轮筛选和优化。\n对于需要个性化反馈的AI教师系统，这类学生模拟器、延续着近期热门的用户模拟器的思想脉络（一切人都可以模拟，建造人类的数字孪生），提供了一条颠覆性的工程路径：\n学习学生如何出错，学习学生如何在指导下改变，为教师模型的强化学习提供机器学习时间尺度的反馈信号。\n参考资料：\nhttps://arxiv.org/abs/2609.01591\n编辑：LRST","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 3670 characters.","diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-10/detail-inirihny3018910.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3670 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3670,"summary_length":3670,"usable_text_length":3670,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3670,"summary_length":3670}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"大模型全是演技派！AI教学的正确方式：用真实数据训出60个数字学生|数学题|作文|教师|模拟器|训练_手机新浪网 - 新浪网","url":"https://finance.sina.cn/stock/jdts/2026-09-10/detail-inirihny3018910.d.html?vt=4&cid=76993&node_id=76993","summary":"大模型全是演技派！AI教学的正确方式：用真实数据训出60个数字学生\n（来源：新智元）\n新智元报道\nAI教师已经可以完成不少单次教学任务。\n一道数学题，它能拆解步骤；一篇英文作文，它能指出语法问题；一盘棋，它也能讲出下一步思路。很多场景里，模型输出已经足够像一位耐心助教。\n但教学效果不能只看教师端。学生听完之后有没有改正错误，是否只是照着提示走，同一句讲解对不同学生是否产生不同效果，这些都发生在学生端。\nAI教师如果要学习个性化指导，也需要反复观察学生反应。\n现实里，这些反应主要来自human study。每次调整教学策略，都要组织学生参与，收集交互，再由人工评估。\nAI模型可以快速更新，但教育反馈的获取速度受human study实验周期限制。\nAI tutor需要学生反馈来改进教学，但真实反馈采集成本较高。StudentSim希望把真实学生记录转化为训练阶段可反复调用的代理反馈。\n近期研究StudentSim，从这个矛盾出发。\n研究团队希望提升AI教师，使其理解学生优劣势，并根据不同学生给出合适指导。推进过程中，团队把问题落到学生模拟器上：能否用真实学生数据训练出可评估、可复用的AI学生，让AI教师在训练阶段获得更多反馈。\n论文链接： https://arxiv.org/abs/2609.01591\n代码链接：https://github.com/microsoft/StudentSim\nHuggingface Paper主页：https://huggingface.co/papers/2609.01591\n这件事放在今天的AI agent研究里并不孤立。User simulator正在成为热门的研究方向，进入客服、电商、医疗问诊、网页操作等场景。研究者会构造模拟用户，让agent在上线前经历更多交互，测试策略、话术和鲁棒性。\n教育场景里的用户模拟更复杂。学生有相对稳定的知识边界、错误习惯和学习轨迹。同一道题，有人会算错符号，有人会误解概念，有人听完提示后可以自己推到答案，有人需要更直接的指导。\n近来被讨论的人类学生数字孪生，也正是围绕这类需求展开。\n建模学生并不是新题目\n从1995年的贝叶斯知识追踪，到深度知识追踪、再到注意力知识追踪，这条方向已经被前人探索了近30年，在拟合学生行为上相当成熟。\n它们的共同缺口在于，模型只接受题目、状态、能力值这类结构化输入，没有一个接收自然语言指导的入口。无论教师说了什么，这类模型无法交互作出像学生一样的表现改变。\n如果直接让大模型扮演学生，看起来很方便。给它写一句「你是一个数学基础薄弱的小学生」，模型可以立刻换成低龄学生口吻，也能表现出犹豫和不确定。\n可是，角色语气和认知水平并不同步。\n一个模型可以用小学生口吻回答「我不太懂」，下一句却给出微积分级别的推理。它看起来在扮演学生，实际反馈仍然受模型自身知识储备影响，可能远远高于它被限制拥有的知识水平。\n用于AI教师训练时，这种认知水平偏差会带来问题。Tutor得到的不是某个学生在当前能力边界下的反应，而是一个高能力模型经过人设包装后的反应。\n也正是因为这样，仅靠一段能力描述做条件，对大模型来说，是一条很脆弱的条件通道。这条路线近两年被大量套用到教育场景，对话辅导语料、多智能体课堂、学习者数据生成都在用；与此同时，一批专门检验其效度的研究也在出现，从架构、保真度基准、教师使用体验三个角度提出质疑。\n教育学中，评价一次指导是否有效，通常不能只看学生独立作答时的表现，也要看学生在接受帮助后能走多远。\nVygotsky提出的最近发展区（zone of proximal development）讨论的就是这件事：学生当前能独立完成什么，和在教师支持下能够完成什么，中间的差距反映了教学可以介入的空间。\n这一想法后来被动态评估（dynamic assessment）落为可操作的测量程序：不只记录学生答对与否，还要在给出提示后观察他的表现如何移动。\n放到学生模拟器上，这个思想对应两类能力。\n第一，模拟器要能复现学生独立作答时的状态，包括能力边界、错误习惯和常见选择。第二，模拟器要能在读到教师指导后产生相应变化，表现出这个学生在帮助下可能出现的更新。\nStudentSim\nStudentSim把这两类能力分别定义为behavioral fidelity和guidance responsiveness，并据此训练和评估个性化学生模拟器。\n学生模拟器需要同时回答两个问题：独立作答时是否像目标学生，接受教师指导后是否产生相应变化。\n训练流程分为两步。\n第一步汇总一个领域内多名学生记录，训练通用学生行为模型。这个阶段学习共性错误、回答格式、指导后的修正路径。\n第二步使用单个学生自己的记录继续训练，得到个性化模拟器。单名学生记录少，直接训练容易过拟合；先学习群体规律，再适配个人数据，可以更稳定地获得每位学生对应的模拟器。\n训练流程\n研究团队同时构建StudentSimEval。评估覆盖60位真实学生，来自国际象棋、第二语言英语写作和基础数学三个场景。\n国际象棋中，模拟器要预测某位玩家在棋局中的走法，并在教练指导后改走位。二语写作中，模拟器要生成符合学习者错误模式的作文，并根据教师批改改写片段。数学中，模拟器要预测学生答案，并在讲解后修正。\n这些任务表面差异很大，评估目标保持一致：先看模拟器是否像学生本人，再看它能否响应指导。所有方法拿到同一份学生记录，在相同held-out测试记录上比较。\n国际象棋结果中，StudentSim的F为0.5150，R为0.9067；GPT-5.4分别为0.2316和0.7186；Maia2分别为0.4535和0.2721。二语写作和数学实验中，StudentSim也在两个指标上超过对应基线。\n国际象棋评测中的二维结果。GPT-5.4响应指导较好，但行为保真较低；Maia2更贴近棋手走法，但缺少自然语言指导入口；StudentSim位于两项指标同时较高的位置。\n这组结果呈现出清晰分工。GPT-5.4能阅读指导，模拟具体学生时保真不足。Maia2更贴近人类棋手走法，无法吸收自然语言教练提示。StudentSim通过真实学习记录训练，并对每位学生进行适配，在个体行为和指导响应两方面同时获得提升。\n不过学生模拟器本身不是目的，终点是，它的功用需要能落地到现实世界，能被用来改进教师模型。\n以往训练AI tutor，奖励信号在一些工作中来自专家标注的优质辅导对话，另外一些来自使用评分量表的通用大模型裁判。也有工作尝试把奖励接到模拟学生上，但采用的都是认知水平并不保真的角色扮演的LLM学生，而不是在真实学习者数据上训练过的模拟器。StudentSim在这一点上提出了不同的做法。\n论文进一步把StudentSim放入AItutor强化学习流程。\n实验场景为国际象棋。系统先取出真实学生犯过的错误走法，AI tutor生成指导，StudentSim读完指导后给出修正走法。\nStockfish用于计算修正走法相对原错误走法的质量变化，这个分数回传给tutor作为RL信号。对照组包括无RL的tutor，以及使用GPT-5.4作为学生模拟器reward的tutor。\nTutor生成指导，冻结的AI学生模拟器给出修正答案，系统根据修正前后的质量变化更新tutor。\n三组tutor使用相同基础模型、SFT起点和GRPO设置，reward来源不同。\n国际象棋评估者进行盲评后，StudentSim reward训练出的tutor在准确性、指导质量和个性化评分上均排在第一。\n专家在打乱呈现顺序的条件下盲评三个维度：准确性看「没有误导性事实错误」的回答占比，指导质量和个性化各为1到5分。StudentSim reward训练出的tutor在三个维度上均排第一。\n更值得注意的是结果反向的一组实验：用GPT-5.4当学生模拟器训出来的tutor，准确性不仅输给StudentSim，还低于完全没做RL的基线，拖后腿的是明显更高的严重事实错误率。模拟器不保真，会把教师往错的方向推：一个认知水平不符合真实学生、但理解能力超强的模拟器，读完再离谱的指导也能自己推出某种答案，于是给错误指导发了随机奖励，RL就朝着混乱（甚至错误）的方向优化。\nStudentSim没有把真实学生实验从教育研究中取代。它把真实学生记录转化成训练阶段可反复调用的模拟反馈，使AI tutor在进入human study前完成更多轮筛选和优化。\n对于需要个性化反馈的AI教师系统，这类学生模拟器、延续着近期热门的用户模拟器的思想脉络（一切人都可以模拟，建造人类的数字孪生），提供了一条颠覆性的工程路径：\n学习学生如何出错，学习学生如何在指导下改变，为教师模型的强化学习提供机器学习时间尺度的反馈信号。\n参考资料：\nhttps://arxiv.org/abs/2609.01591\n编辑：LRST","source":"新浪网","date":"2026-09-10T06:11:15+00:00","content":"大模型全是演技派！AI教学的正确方式：用真实数据训出60个数字学生\n（来源：新智元）\n新智元报道\nAI教师已经可以完成不少单次教学任务。\n一道数学题，它能拆解步骤；一篇英文作文，它能指出语法问题；一盘棋，它也能讲出下一步思路。很多场景里，模型输出已经足够像一位耐心助教。\n但教学效果不能只看教师端。学生听完之后有没有改正错误，是否只是照着提示走，同一句讲解对不同学生是否产生不同效果，这些都发生在学生端。\nAI教师如果要学习个性化指导，也需要反复观察学生反应。\n现实里，这些反应主要来自human study。每次调整教学策略，都要组织学生参与，收集交互，再由人工评估。\nAI模型可以快速更新，但教育反馈的获取速度受human study实验周期限制。\nAI tutor需要学生反馈来改进教学，但真实反馈采集成本较高。StudentSim希望把真实学生记录转化为训练阶段可反复调用的代理反馈。\n近期研究StudentSim，从这个矛盾出发。\n研究团队希望提升AI教师，使其理解学生优劣势，并根据不同学生给出合适指导。推进过程中，团队把问题落到学生模拟器上：能否用真实学生数据训练出可评估、可复用的AI学生，让AI教师在训练阶段获得更多反馈。\n论文链接： https://arxiv.org/abs/2609.01591\n代码链接：https://github.com/microsoft/StudentSim\nHuggingface Paper主页：https://huggingface.co/papers/2609.01591\n这件事放在今天的AI agent研究里并不孤立。User simulator正在成为热门的研究方向，进入客服、电商、医疗问诊、网页操作等场景。研究者会构造模拟用户，让agent在上线前经历更多交互，测试策略、话术和鲁棒性。\n教育场景里的用户模拟更复杂。学生有相对稳定的知识边界、错误习惯和学习轨迹。同一道题，有人会算错符号，有人会误解概念，有人听完提示后可以自己推到答案，有人需要更直接的指导。\n近来被讨论的人类学生数字孪生，也正是围绕这类需求展开。\n建模学生并不是新题目\n从1995年的贝叶斯知识追踪，到深度知识追踪、再到注意力知识追踪，这条方向已经被前人探索了近30年，在拟合学生行为上相当成熟。\n它们的共同缺口在于，模型只接受题目、状态、能力值这类结构化输入，没有一个接收自然语言指导的入口。无论教师说了什么，这类模型无法交互作出像学生一样的表现改变。\n如果直接让大模型扮演学生，看起来很方便。给它写一句「你是一个数学基础薄弱的小学生」，模型可以立刻换成低龄学生口吻，也能表现出犹豫和不确定。\n可是，角色语气和认知水平并不同步。\n一个模型可以用小学生口吻回答「我不太懂」，下一句却给出微积分级别的推理。它看起来在扮演学生，实际反馈仍然受模型自身知识储备影响，可能远远高于它被限制拥有的知识水平。\n用于AI教师训练时，这种认知水平偏差会带来问题。Tutor得到的不是某个学生在当前能力边界下的反应，而是一个高能力模型经过人设包装后的反应。\n也正是因为这样，仅靠一段能力描述做条件，对大模型来说，是一条很脆弱的条件通道。这条路线近两年被大量套用到教育场景，对话辅导语料、多智能体课堂、学习者数据生成都在用；与此同时，一批专门检验其效度的研究也在出现，从架构、保真度基准、教师使用体验三个角度提出质疑。\n教育学中，评价一次指导是否有效，通常不能只看学生独立作答时的表现，也要看学生在接受帮助后能走多远。\nVygotsky提出的最近发展区（zone of proximal development）讨论的就是这件事：学生当前能独立完成什么，和在教师支持下能够完成什么，中间的差距反映了教学可以介入的空间。\n这一想法后来被动态评估（dynamic assessment）落为可操作的测量程序：不只记录学生答对与否，还要在给出提示后观察他的表现如何移动。\n放到学生模拟器上，这个思想对应两类能力。\n第一，模拟器要能复现学生独立作答时的状态，包括能力边界、错误习惯和常见选择。第二，模拟器要能在读到教师指导后产生相应变化，表现出这个学生在帮助下可能出现的更新。\nStudentSim\nStudentSim把这两类能力分别定义为behavioral fidelity和guidance responsiveness，并据此训练和评估个性化学生模拟器。\n学生模拟器需要同时回答两个问题：独立作答时是否像目标学生，接受教师指导后是否产生相应变化。\n训练流程分为两步。\n第一步汇总一个领域内多名学生记录，训练通用学生行为模型。这个阶段学习共性错误、回答格式、指导后的修正路径。\n第二步使用单个学生自己的记录继续训练，得到个性化模拟器。单名学生记录少，直接训练容易过拟合；先学习群体规律，再适配个人数据，可以更稳定地获得每位学生对应的模拟器。\n训练流程\n研究团队同时构建StudentSimEval。评估覆盖60位真实学生，来自国际象棋、第二语言英语写作和基础数学三个场景。\n国际象棋中，模拟器要预测某位玩家在棋局中的走法，并在教练指导后改走位。二语写作中，模拟器要生成符合学习者错误模式的作文，并根据教师批改改写片段。数学中，模拟器要预测学生答案，并在讲解后修正。\n这些任务表面差异很大，评估目标保持一致：先看模拟器是否像学生本人，再看它能否响应指导。所有方法拿到同一份学生记录，在相同held-out测试记录上比较。\n国际象棋结果中，StudentSim的F为0.5150，R为0.9067；GPT-5.4分别为0.2316和0.7186；Maia2分别为0.4535和0.2721。二语写作和数学实验中，StudentSim也在两个指标上超过对应基线。\n国际象棋评测中的二维结果。GPT-5.4响应指导较好，但行为保真较低；Maia2更贴近棋手走法，但缺少自然语言指导入口；StudentSim位于两项指标同时较高的位置。\n这组结果呈现出清晰分工。GPT-5.4能阅读指导，模拟具体学生时保真不足。Maia2更贴近人类棋手走法，无法吸收自然语言教练提示。StudentSim通过真实学习记录训练，并对每位学生进行适配，在个体行为和指导响应两方面同时获得提升。\n不过学生模拟器本身不是目的，终点是，它的功用需要能落地到现实世界，能被用来改进教师模型。\n以往训练AI tutor，奖励信号在一些工作中来自专家标注的优质辅导对话，另外一些来自使用评分量表的通用大模型裁判。也有工作尝试把奖励接到模拟学生上，但采用的都是认知水平并不保真的角色扮演的LLM学生，而不是在真实学习者数据上训练过的模拟器。StudentSim在这一点上提出了不同的做法。\n论文进一步把StudentSim放入AItutor强化学习流程。\n实验场景为国际象棋。系统先取出真实学生犯过的错误走法，AI tutor生成指导，StudentSim读完指导后给出修正走法。\nStockfish用于计算修正走法相对原错误走法的质量变化，这个分数回传给tutor作为RL信号。对照组包括无RL的tutor，以及使用GPT-5.4作为学生模拟器reward的tutor。\nTutor生成指导，冻结的AI学生模拟器给出修正答案，系统根据修正前后的质量变化更新tutor。\n三组tutor使用相同基础模型、SFT起点和GRPO设置，reward来源不同。\n国际象棋评估者进行盲评后，StudentSim reward训练出的tutor在准确性、指导质量和个性化评分上均排在第一。\n专家在打乱呈现顺序的条件下盲评三个维度：准确性看「没有误导性事实错误」的回答占比，指导质量和个性化各为1到5分。StudentSim reward训练出的tutor在三个维度上均排第一。\n更值得注意的是结果反向的一组实验：用GPT-5.4当学生模拟器训出来的tutor，准确性不仅输给StudentSim，还低于完全没做RL的基线，拖后腿的是明显更高的严重事实错误率。模拟器不保真，会把教师往错的方向推：一个认知水平不符合真实学生、但理解能力超强的模拟器，读完再离谱的指导也能自己推出某种答案，于是给错误指导发了随机奖励，RL就朝着混乱（甚至错误）的方向优化。\nStudentSim没有把真实学生实验从教育研究中取代。它把真实学生记录转化成训练阶段可反复调用的模拟反馈，使AI tutor在进入human study前完成更多轮筛选和优化。\n对于需要个性化反馈的AI教师系统，这类学生模拟器、延续着近期热门的用户模拟器的思想脉络（一切人都可以模拟，建造人类的数字孪生），提供了一条颠覆性的工程路径：\n学习学生如何出错，学习学生如何在指导下改变，为教师模型的强化学习提供机器学习时间尺度的反馈信号。\n参考资料：\nhttps://arxiv.org/abs/2609.01591\n编辑：LRST","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-10/detail-inirihny3018910.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 3670 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3670 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3670,"summary_length":3670,"usable_text_length":3670,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3670,"summary_length":3670}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/79231","export_markdown":"/api/items/79231/export?format=markdown","export_json":"/api/items/79231/export?format=json","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-10/detail-inirihny3018910.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993"},"formats":{"full":{"id":79231,"title":"大模型全是演技派！AI教学的正确方式：用真实数据训出60个数字学生|数学题|作文|教师|模拟器|训练_手机新浪网 - 新浪网","url":"https://finance.sina.cn/stock/jdts/2026-09-10/detail-inirihny3018910.d.html?vt=4&cid=76993&node_id=76993","source":"新浪网","author":null,"published_at":"2026-09-10T06:11:15+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"大模型全是演技派！AI教学的正确方式：用真实数据训出60个数字学生\n（来源：新智元）\n新智元报道\nAI教师已经可以完成不少单次教学任务。\n一道数学题，它能拆解步骤；一篇英文作文，它能指出语法问题；一盘棋，它也能讲出下一步思路。很多场景里，模型输出已经足够像一位耐心助教。\n但教学效果不能只看教师端。学生听完之后有没有改正错误，是否只是照着提示走，同一句讲解对不同学生是否产生不同效果，这些都发生在学生端。\nAI教师如果要学习个性化指导，也需要反复观察学生反应。\n现实里，这些反应主要来自human study。每次调整教学策略，都要组织学生参与，收集交互，再由人工评估。\nAI模型可以快速更新，但教育反馈的获取速度受human study实验周期限制。\nAI tutor需要学生反馈来改进教学，但真实反馈采集成本较高。StudentSim希望把真实学生记录转化为训练阶段可反复调用的代理反馈。\n近期研究StudentSim，从这个矛盾出发。\n研究团队希望提升AI教师，使其理解学生优劣势，并根据不同学生给出合适指导。推进过程中，团队把问题落到学生模拟器上：能否用真实学生数据训练出可评估、可复用的AI学生，让AI教师在训练阶段获得更多反馈。\n论文链接： https://arxiv.org/abs/2609.01591\n代码链接：https://github.com/microsoft/StudentSim\nHuggingface Paper主页：https://huggingface.co/papers/2609.01591\n这件事放在今天的AI agent研究里并不孤立。User simulator正在成为热门的研究方向，进入客服、电商、医疗问诊、网页操作等场景。研究者会构造模拟用户，让agent在上线前经历更多交互，测试策略、话术和鲁棒性。\n教育场景里的用户模拟更复杂。学生有相对稳定的知识边界、错误习惯和学习轨迹。同一道题，有人会算错符号，有人会误解概念，有人听完提示后可以自己推到答案，有人需要更直接的指导。\n近来被讨论的人类学生数字孪生，也正是围绕这类需求展开。\n建模学生并不是新题目\n从1995年的贝叶斯知识追踪，到深度知识追踪、再到注意力知识追踪，这条方向已经被前人探索了近30年，在拟合学生行为上相当成熟。\n它们的共同缺口在于，模型只接受题目、状态、能力值这类结构化输入，没有一个接收自然语言指导的入口。无论教师说了什么，这类模型无法交互作出像学生一样的表现改变。\n如果直接让大模型扮演学生，看起来很方便。给它写一句「你是一个数学基础薄弱的小学生」，模型可以立刻换成低龄学生口吻，也能表现出犹豫和不确定。\n可是，角色语气和认知水平并不同步。\n一个模型可以用小学生口吻回答「我不太懂」，下一句却给出微积分级别的推理。它看起来在扮演学生，实际反馈仍然受模型自身知识储备影响，可能远远高于它被限制拥有的知识水平。\n用于AI教师训练时，这种认知水平偏差会带来问题。Tutor得到的不是某个学生在当前能力边界下的反应，而是一个高能力模型经过人设包装后的反应。\n也正是因为这样，仅靠一段能力描述做条件，对大模型来说，是一条很脆弱的条件通道。这条路线近两年被大量套用到教育场景，对话辅导语料、多智能体课堂、学习者数据生成都在用；与此同时，一批专门检验其效度的研究也在出现，从架构、保真度基准、教师使用体验三个角度提出质疑。\n教育学中，评价一次指导是否有效，通常不能只看学生独立作答时的表现，也要看学生在接受帮助后能走多远。\nVygotsky提出的最近发展区（zone of proximal development）讨论的就是这件事：学生当前能独立完成什么，和在教师支持下能够完成什么，中间的差距反映了教学可以介入的空间。\n这一想法后来被动态评估（dynamic assessment）落为可操作的测量程序：不只记录学生答对与否，还要在给出提示后观察他的表现如何移动。\n放到学生模拟器上，这个思想对应两类能力。\n第一，模拟器要能复现学生独立作答时的状态，包括能力边界、错误习惯和常见选择。第二，模拟器要能在读到教师指导后产生相应变化，表现出这个学生在帮助下可能出现的更新。\nStudentSim\nStudentSim把这两类能力分别定义为behavioral fidelity和guidance responsiveness，并据此训练和评估个性化学生模拟器。\n学生模拟器需要同时回答两个问题：独立作答时是否像目标学生，接受教师指导后是否产生相应变化。\n训练流程分为两步。\n第一步汇总一个领域内多名学生记录，训练通用学生行为模型。这个阶段学习共性错误、回答格式、指导后的修正路径。\n第二步使用单个学生自己的记录继续训练，得到个性化模拟器。单名学生记录少，直接训练容易过拟合；先学习群体规律，再适配个人数据，可以更稳定地获得每位学生对应的模拟器。\n训练流程\n研究团队同时构建StudentSimEval。评估覆盖60位真实学生，来自国际象棋、第二语言英语写作和基础数学三个场景。\n国际象棋中，模拟器要预测某位玩家在棋局中的走法，并在教练指导后改走位。二语写作中，模拟器要生成符合学习者错误模式的作文，并根据教师批改改写片段。数学中，模拟器要预测学生答案，并在讲解后修正。\n这些任务表面差异很大，评估目标保持一致：先看模拟器是否像学生本人，再看它能否响应指导。所有方法拿到同一份学生记录，在相同held-out测试记录上比较。\n国际象棋结果中，StudentSim的F为0.5150，R为0.9067；GPT-5.4分别为0.2316和0.7186；Maia2分别为0.4535和0.2721。二语写作和数学实验中，StudentSim也在两个指标上超过对应基线。\n国际象棋评测中的二维结果。GPT-5.4响应指导较好，但行为保真较低；Maia2更贴近棋手走法，但缺少自然语言指导入口；StudentSim位于两项指标同时较高的位置。\n这组结果呈现出清晰分工。GPT-5.4能阅读指导，模拟具体学生时保真不足。Maia2更贴近人类棋手走法，无法吸收自然语言教练提示。StudentSim通过真实学习记录训练，并对每位学生进行适配，在个体行为和指导响应两方面同时获得提升。\n不过学生模拟器本身不是目的，终点是，它的功用需要能落地到现实世界，能被用来改进教师模型。\n以往训练AI tutor，奖励信号在一些工作中来自专家标注的优质辅导对话，另外一些来自使用评分量表的通用大模型裁判。也有工作尝试把奖励接到模拟学生上，但采用的都是认知水平并不保真的角色扮演的LLM学生，而不是在真实学习者数据上训练过的模拟器。StudentSim在这一点上提出了不同的做法。\n论文进一步把StudentSim放入AItutor强化学习流程。\n实验场景为国际象棋。系统先取出真实学生犯过的错误走法，AI tutor生成指导，StudentSim读完指导后给出修正走法。\nStockfish用于计算修正走法相对原错误走法的质量变化，这个分数回传给tutor作为RL信号。对照组包括无RL的tutor，以及使用GPT-5.4作为学生模拟器reward的tutor。\nTutor生成指导，冻结的AI学生模拟器给出修正答案，系统根据修正前后的质量变化更新tutor。\n三组tutor使用相同基础模型、SFT起点和GRPO设置，reward来源不同。\n国际象棋评估者进行盲评后，StudentSim reward训练出的tutor在准确性、指导质量和个性化评分上均排在第一。\n专家在打乱呈现顺序的条件下盲评三个维度：准确性看「没有误导性事实错误」的回答占比，指导质量和个性化各为1到5分。StudentSim reward训练出的tutor在三个维度上均排第一。\n更值得注意的是结果反向的一组实验：用GPT-5.4当学生模拟器训出来的tutor，准确性不仅输给StudentSim，还低于完全没做RL的基线，拖后腿的是明显更高的严重事实错误率。模拟器不保真，会把教师往错的方向推：一个认知水平不符合真实学生、但理解能力超强的模拟器，读完再离谱的指导也能自己推出某种答案，于是给错误指导发了随机奖励，RL就朝着混乱（甚至错误）的方向优化。\nStudentSim没有把真实学生实验从教育研究中取代。它把真实学生记录转化成训练阶段可反复调用的模拟反馈，使AI tutor在进入human study前完成更多轮筛选和优化。\n对于需要个性化反馈的AI教师系统，这类学生模拟器、延续着近期热门的用户模拟器的思想脉络（一切人都可以模拟，建造人类的数字孪生），提供了一条颠覆性的工程路径：\n学习学生如何出错，学习学生如何在指导下改变，为教师模型的强化学习提供机器学习时间尺度的反馈信号。\n参考资料：\nhttps://arxiv.org/abs/2609.01591\n编辑：LRST","full_text":"大模型全是演技派！AI教学的正确方式：用真实数据训出60个数字学生\n（来源：新智元）\n新智元报道\nAI教师已经可以完成不少单次教学任务。\n一道数学题，它能拆解步骤；一篇英文作文，它能指出语法问题；一盘棋，它也能讲出下一步思路。很多场景里，模型输出已经足够像一位耐心助教。\n但教学效果不能只看教师端。学生听完之后有没有改正错误，是否只是照着提示走，同一句讲解对不同学生是否产生不同效果，这些都发生在学生端。\nAI教师如果要学习个性化指导，也需要反复观察学生反应。\n现实里，这些反应主要来自human study。每次调整教学策略，都要组织学生参与，收集交互，再由人工评估。\nAI模型可以快速更新，但教育反馈的获取速度受human study实验周期限制。\nAI tutor需要学生反馈来改进教学，但真实反馈采集成本较高。StudentSim希望把真实学生记录转化为训练阶段可反复调用的代理反馈。\n近期研究StudentSim，从这个矛盾出发。\n研究团队希望提升AI教师，使其理解学生优劣势，并根据不同学生给出合适指导。推进过程中，团队把问题落到学生模拟器上：能否用真实学生数据训练出可评估、可复用的AI学生，让AI教师在训练阶段获得更多反馈。\n论文链接： https://arxiv.org/abs/2609.01591\n代码链接：https://github.com/microsoft/StudentSim\nHuggingface Paper主页：https://huggingface.co/papers/2609.01591\n这件事放在今天的AI agent研究里并不孤立。User simulator正在成为热门的研究方向，进入客服、电商、医疗问诊、网页操作等场景。研究者会构造模拟用户，让agent在上线前经历更多交互，测试策略、话术和鲁棒性。\n教育场景里的用户模拟更复杂。学生有相对稳定的知识边界、错误习惯和学习轨迹。同一道题，有人会算错符号，有人会误解概念，有人听完提示后可以自己推到答案，有人需要更直接的指导。\n近来被讨论的人类学生数字孪生，也正是围绕这类需求展开。\n建模学生并不是新题目\n从1995年的贝叶斯知识追踪，到深度知识追踪、再到注意力知识追踪，这条方向已经被前人探索了近30年，在拟合学生行为上相当成熟。\n它们的共同缺口在于，模型只接受题目、状态、能力值这类结构化输入，没有一个接收自然语言指导的入口。无论教师说了什么，这类模型无法交互作出像学生一样的表现改变。\n如果直接让大模型扮演学生，看起来很方便。给它写一句「你是一个数学基础薄弱的小学生」，模型可以立刻换成低龄学生口吻，也能表现出犹豫和不确定。\n可是，角色语气和认知水平并不同步。\n一个模型可以用小学生口吻回答「我不太懂」，下一句却给出微积分级别的推理。它看起来在扮演学生，实际反馈仍然受模型自身知识储备影响，可能远远高于它被限制拥有的知识水平。\n用于AI教师训练时，这种认知水平偏差会带来问题。Tutor得到的不是某个学生在当前能力边界下的反应，而是一个高能力模型经过人设包装后的反应。\n也正是因为这样，仅靠一段能力描述做条件，对大模型来说，是一条很脆弱的条件通道。这条路线近两年被大量套用到教育场景，对话辅导语料、多智能体课堂、学习者数据生成都在用；与此同时，一批专门检验其效度的研究也在出现，从架构、保真度基准、教师使用体验三个角度提出质疑。\n教育学中，评价一次指导是否有效，通常不能只看学生独立作答时的表现，也要看学生在接受帮助后能走多远。\nVygotsky提出的最近发展区（zone of proximal development）讨论的就是这件事：学生当前能独立完成什么，和在教师支持下能够完成什么，中间的差距反映了教学可以介入的空间。\n这一想法后来被动态评估（dynamic assessment）落为可操作的测量程序：不只记录学生答对与否，还要在给出提示后观察他的表现如何移动。\n放到学生模拟器上，这个思想对应两类能力。\n第一，模拟器要能复现学生独立作答时的状态，包括能力边界、错误习惯和常见选择。第二，模拟器要能在读到教师指导后产生相应变化，表现出这个学生在帮助下可能出现的更新。\nStudentSim\nStudentSim把这两类能力分别定义为behavioral fidelity和guidance responsiveness，并据此训练和评估个性化学生模拟器。\n学生模拟器需要同时回答两个问题：独立作答时是否像目标学生，接受教师指导后是否产生相应变化。\n训练流程分为两步。\n第一步汇总一个领域内多名学生记录，训练通用学生行为模型。这个阶段学习共性错误、回答格式、指导后的修正路径。\n第二步使用单个学生自己的记录继续训练，得到个性化模拟器。单名学生记录少，直接训练容易过拟合；先学习群体规律，再适配个人数据，可以更稳定地获得每位学生对应的模拟器。\n训练流程\n研究团队同时构建StudentSimEval。评估覆盖60位真实学生，来自国际象棋、第二语言英语写作和基础数学三个场景。\n国际象棋中，模拟器要预测某位玩家在棋局中的走法，并在教练指导后改走位。二语写作中，模拟器要生成符合学习者错误模式的作文，并根据教师批改改写片段。数学中，模拟器要预测学生答案，并在讲解后修正。\n这些任务表面差异很大，评估目标保持一致：先看模拟器是否像学生本人，再看它能否响应指导。所有方法拿到同一份学生记录，在相同held-out测试记录上比较。\n国际象棋结果中，StudentSim的F为0.5150，R为0.9067；GPT-5.4分别为0.2316和0.7186；Maia2分别为0.4535和0.2721。二语写作和数学实验中，StudentSim也在两个指标上超过对应基线。\n国际象棋评测中的二维结果。GPT-5.4响应指导较好，但行为保真较低；Maia2更贴近棋手走法，但缺少自然语言指导入口；StudentSim位于两项指标同时较高的位置。\n这组结果呈现出清晰分工。GPT-5.4能阅读指导，模拟具体学生时保真不足。Maia2更贴近人类棋手走法，无法吸收自然语言教练提示。StudentSim通过真实学习记录训练，并对每位学生进行适配，在个体行为和指导响应两方面同时获得提升。\n不过学生模拟器本身不是目的，终点是，它的功用需要能落地到现实世界，能被用来改进教师模型。\n以往训练AI tutor，奖励信号在一些工作中来自专家标注的优质辅导对话，另外一些来自使用评分量表的通用大模型裁判。也有工作尝试把奖励接到模拟学生上，但采用的都是认知水平并不保真的角色扮演的LLM学生，而不是在真实学习者数据上训练过的模拟器。StudentSim在这一点上提出了不同的做法。\n论文进一步把StudentSim放入AItutor强化学习流程。\n实验场景为国际象棋。系统先取出真实学生犯过的错误走法，AI tutor生成指导，StudentSim读完指导后给出修正走法。\nStockfish用于计算修正走法相对原错误走法的质量变化，这个分数回传给tutor作为RL信号。对照组包括无RL的tutor，以及使用GPT-5.4作为学生模拟器reward的tutor。\nTutor生成指导，冻结的AI学生模拟器给出修正答案，系统根据修正前后的质量变化更新tutor。\n三组tutor使用相同基础模型、SFT起点和GRPO设置，reward来源不同。\n国际象棋评估者进行盲评后，StudentSim reward训练出的tutor在准确性、指导质量和个性化评分上均排在第一。\n专家在打乱呈现顺序的条件下盲评三个维度：准确性看「没有误导性事实错误」的回答占比，指导质量和个性化各为1到5分。StudentSim reward训练出的tutor在三个维度上均排第一。\n更值得注意的是结果反向的一组实验：用GPT-5.4当学生模拟器训出来的tutor，准确性不仅输给StudentSim，还低于完全没做RL的基线，拖后腿的是明显更高的严重事实错误率。模拟器不保真，会把教师往错的方向推：一个认知水平不符合真实学生、但理解能力超强的模拟器，读完再离谱的指导也能自己推出某种答案，于是给错误指导发了随机奖励，RL就朝着混乱（甚至错误）的方向优化。\nStudentSim没有把真实学生实验从教育研究中取代。它把真实学生记录转化成训练阶段可反复调用的模拟反馈，使AI tutor在进入human study前完成更多轮筛选和优化。\n对于需要个性化反馈的AI教师系统，这类学生模拟器、延续着近期热门的用户模拟器的思想脉络（一切人都可以模拟，建造人类的数字孪生），提供了一条颠覆性的工程路径：\n学习学生如何出错，学习学生如何在指导下改变，为教师模型的强化学习提供机器学习时间尺度的反馈信号。\n参考资料：\nhttps://arxiv.org/abs/2609.01591\n编辑：LRST","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 3670 characters.","diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-10/detail-inirihny3018910.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3670 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3670,"summary_length":3670,"usable_text_length":3670,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3670,"summary_length":3670}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3670 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3670,"summary_length":3670,"usable_text_length":3670,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3670,"summary_length":3670}},"actions":{"read":"/item/79231","export_markdown":"/api/items/79231/export?format=markdown","export_json":"/api/items/79231/export?format=json","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-10/detail-inirihny3018910.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993"}},"digest":{"id":79231,"title":"大模型全是演技派！AI教学的正确方式：用真实数据训出60个数字学生|数学题|作文|教师|模拟器|训练_手机新浪网 - 新浪网","url":"https://finance.sina.cn/stock/jdts/2026-09-10/detail-inirihny3018910.d.html?vt=4&cid=76993&node_id=76993","source":"新浪网","topic":"ai","published_at":"2026-09-10T06:11:15+00:00","excerpt":"大模型全是演技派！AI教学的正确方式：用真实数据训出60个数字学生 （来源：新智元） 新智元报道 AI教师已经可以完成不少单次教学任务。 一道数学题，它能拆解步骤；一篇英文作文，它能指出语法问题；一盘棋，它也能讲出下一步思路。很多场景里，模型输出已经足够像一位耐心助教。 但教学效果不能只看教师端。学生听完之后有没有改正错误，是否只是照着提示走，同一句讲解对不同学生是否产生不同效果，这些都发生在学生端。 AI教师如果要学习个性化指导，也需要反复观察学生反应。 现实里，这些反应主要来自human…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 3670 characters.","reading_time_min":1,"cluster_id":3510347},"card":{"display_title":"大模型全是演技派！AI教学的正确方式：用真实数据训出60个数字学生|数学题|作文|教师|模拟器|训练_手机新浪网 - 新浪网","subtitle":"新浪网 · 2026-09-10","summary":"大模型全是演技派！AI教学的正确方式：用真实数据训出60个数字学生 （来源：新智元） 新智元报道 AI教师已经可以完成不少单次教学任务。 一道数学题，它能拆解步骤；一篇英文作文，它能指出语法问题；一盘棋，它也能讲出下一步思路。很多场景里，模型输出已经足够像一位耐心助教。 但教学效果不能只看教师端。学生听完之后有没有改正错误，是否只是照着提示走，同一句讲解对不同学生是否产生不同效果，这些都发生在学生端。…","badges":["quality:high"],"links":{"read":"/item/79231","original":"https://finance.sina.cn/stock/jdts/2026-09-10/detail-inirihny3018910.d.html?vt=4&cid=76993&node_id=76993","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-10/detail-inirihny3018910.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993"},"quality_warning":null},"export":{"title":"大模型全是演技派！AI教学的正确方式：用真实数据训出60个数字学生|数学题|作文|教师|模拟器|训练_手机新浪网 - 新浪网","url":"https://finance.sina.cn/stock/jdts/2026-09-10/detail-inirihny3018910.d.html?vt=4&cid=76993&node_id=76993","summary":"大模型全是演技派！AI教学的正确方式：用真实数据训出60个数字学生\n（来源：新智元）\n新智元报道\nAI教师已经可以完成不少单次教学任务。\n一道数学题，它能拆解步骤；一篇英文作文，它能指出语法问题；一盘棋，它也能讲出下一步思路。很多场景里，模型输出已经足够像一位耐心助教。\n但教学效果不能只看教师端。学生听完之后有没有改正错误，是否只是照着提示走，同一句讲解对不同学生是否产生不同效果，这些都发生在学生端。\nAI教师如果要学习个性化指导，也需要反复观察学生反应。\n现实里，这些反应主要来自human study。每次调整教学策略，都要组织学生参与，收集交互，再由人工评估。\nAI模型可以快速更新，但教育反馈的获取速度受human study实验周期限制。\nAI tutor需要学生反馈来改进教学，但真实反馈采集成本较高。StudentSim希望把真实学生记录转化为训练阶段可反复调用的代理反馈。\n近期研究StudentSim，从这个矛盾出发。\n研究团队希望提升AI教师，使其理解学生优劣势，并根据不同学生给出合适指导。推进过程中，团队把问题落到学生模拟器上：能否用真实学生数据训练出可评估、可复用的AI学生，让AI教师在训练阶段获得更多反馈。\n论文链接： https://arxiv.org/abs/2609.01591\n代码链接：https://github.com/microsoft/StudentSim\nHuggingface Paper主页：https://huggingface.co/papers/2609.01591\n这件事放在今天的AI agent研究里并不孤立。User simulator正在成为热门的研究方向，进入客服、电商、医疗问诊、网页操作等场景。研究者会构造模拟用户，让agent在上线前经历更多交互，测试策略、话术和鲁棒性。\n教育场景里的用户模拟更复杂。学生有相对稳定的知识边界、错误习惯和学习轨迹。同一道题，有人会算错符号，有人会误解概念，有人听完提示后可以自己推到答案，有人需要更直接的指导。\n近来被讨论的人类学生数字孪生，也正是围绕这类需求展开。\n建模学生并不是新题目\n从1995年的贝叶斯知识追踪，到深度知识追踪、再到注意力知识追踪，这条方向已经被前人探索了近30年，在拟合学生行为上相当成熟。\n它们的共同缺口在于，模型只接受题目、状态、能力值这类结构化输入，没有一个接收自然语言指导的入口。无论教师说了什么，这类模型无法交互作出像学生一样的表现改变。\n如果直接让大模型扮演学生，看起来很方便。给它写一句「你是一个数学基础薄弱的小学生」，模型可以立刻换成低龄学生口吻，也能表现出犹豫和不确定。\n可是，角色语气和认知水平并不同步。\n一个模型可以用小学生口吻回答「我不太懂」，下一句却给出微积分级别的推理。它看起来在扮演学生，实际反馈仍然受模型自身知识储备影响，可能远远高于它被限制拥有的知识水平。\n用于AI教师训练时，这种认知水平偏差会带来问题。Tutor得到的不是某个学生在当前能力边界下的反应，而是一个高能力模型经过人设包装后的反应。\n也正是因为这样，仅靠一段能力描述做条件，对大模型来说，是一条很脆弱的条件通道。这条路线近两年被大量套用到教育场景，对话辅导语料、多智能体课堂、学习者数据生成都在用；与此同时，一批专门检验其效度的研究也在出现，从架构、保真度基准、教师使用体验三个角度提出质疑。\n教育学中，评价一次指导是否有效，通常不能只看学生独立作答时的表现，也要看学生在接受帮助后能走多远。\nVygotsky提出的最近发展区（zone of proximal development）讨论的就是这件事：学生当前能独立完成什么，和在教师支持下能够完成什么，中间的差距反映了教学可以介入的空间。\n这一想法后来被动态评估（dynamic assessment）落为可操作的测量程序：不只记录学生答对与否，还要在给出提示后观察他的表现如何移动。\n放到学生模拟器上，这个思想对应两类能力。\n第一，模拟器要能复现学生独立作答时的状态，包括能力边界、错误习惯和常见选择。第二，模拟器要能在读到教师指导后产生相应变化，表现出这个学生在帮助下可能出现的更新。\nStudentSim\nStudentSim把这两类能力分别定义为behavioral fidelity和guidance responsiveness，并据此训练和评估个性化学生模拟器。\n学生模拟器需要同时回答两个问题：独立作答时是否像目标学生，接受教师指导后是否产生相应变化。\n训练流程分为两步。\n第一步汇总一个领域内多名学生记录，训练通用学生行为模型。这个阶段学习共性错误、回答格式、指导后的修正路径。\n第二步使用单个学生自己的记录继续训练，得到个性化模拟器。单名学生记录少，直接训练容易过拟合；先学习群体规律，再适配个人数据，可以更稳定地获得每位学生对应的模拟器。\n训练流程\n研究团队同时构建StudentSimEval。评估覆盖60位真实学生，来自国际象棋、第二语言英语写作和基础数学三个场景。\n国际象棋中，模拟器要预测某位玩家在棋局中的走法，并在教练指导后改走位。二语写作中，模拟器要生成符合学习者错误模式的作文，并根据教师批改改写片段。数学中，模拟器要预测学生答案，并在讲解后修正。\n这些任务表面差异很大，评估目标保持一致：先看模拟器是否像学生本人，再看它能否响应指导。所有方法拿到同一份学生记录，在相同held-out测试记录上比较。\n国际象棋结果中，StudentSim的F为0.5150，R为0.9067；GPT-5.4分别为0.2316和0.7186；Maia2分别为0.4535和0.2721。二语写作和数学实验中，StudentSim也在两个指标上超过对应基线。\n国际象棋评测中的二维结果。GPT-5.4响应指导较好，但行为保真较低；Maia2更贴近棋手走法，但缺少自然语言指导入口；StudentSim位于两项指标同时较高的位置。\n这组结果呈现出清晰分工。GPT-5.4能阅读指导，模拟具体学生时保真不足。Maia2更贴近人类棋手走法，无法吸收自然语言教练提示。StudentSim通过真实学习记录训练，并对每位学生进行适配，在个体行为和指导响应两方面同时获得提升。\n不过学生模拟器本身不是目的，终点是，它的功用需要能落地到现实世界，能被用来改进教师模型。\n以往训练AI tutor，奖励信号在一些工作中来自专家标注的优质辅导对话，另外一些来自使用评分量表的通用大模型裁判。也有工作尝试把奖励接到模拟学生上，但采用的都是认知水平并不保真的角色扮演的LLM学生，而不是在真实学习者数据上训练过的模拟器。StudentSim在这一点上提出了不同的做法。\n论文进一步把StudentSim放入AItutor强化学习流程。\n实验场景为国际象棋。系统先取出真实学生犯过的错误走法，AI tutor生成指导，StudentSim读完指导后给出修正走法。\nStockfish用于计算修正走法相对原错误走法的质量变化，这个分数回传给tutor作为RL信号。对照组包括无RL的tutor，以及使用GPT-5.4作为学生模拟器reward的tutor。\nTutor生成指导，冻结的AI学生模拟器给出修正答案，系统根据修正前后的质量变化更新tutor。\n三组tutor使用相同基础模型、SFT起点和GRPO设置，reward来源不同。\n国际象棋评估者进行盲评后，StudentSim reward训练出的tutor在准确性、指导质量和个性化评分上均排在第一。\n专家在打乱呈现顺序的条件下盲评三个维度：准确性看「没有误导性事实错误」的回答占比，指导质量和个性化各为1到5分。StudentSim reward训练出的tutor在三个维度上均排第一。\n更值得注意的是结果反向的一组实验：用GPT-5.4当学生模拟器训出来的tutor，准确性不仅输给StudentSim，还低于完全没做RL的基线，拖后腿的是明显更高的严重事实错误率。模拟器不保真，会把教师往错的方向推：一个认知水平不符合真实学生、但理解能力超强的模拟器，读完再离谱的指导也能自己推出某种答案，于是给错误指导发了随机奖励，RL就朝着混乱（甚至错误）的方向优化。\nStudentSim没有把真实学生实验从教育研究中取代。它把真实学生记录转化成训练阶段可反复调用的模拟反馈，使AI tutor在进入human study前完成更多轮筛选和优化。\n对于需要个性化反馈的AI教师系统，这类学生模拟器、延续着近期热门的用户模拟器的思想脉络（一切人都可以模拟，建造人类的数字孪生），提供了一条颠覆性的工程路径：\n学习学生如何出错，学习学生如何在指导下改变，为教师模型的强化学习提供机器学习时间尺度的反馈信号。\n参考资料：\nhttps://arxiv.org/abs/2609.01591\n编辑：LRST","source":"新浪网","date":"2026-09-10T06:11:15+00:00","content":"大模型全是演技派！AI教学的正确方式：用真实数据训出60个数字学生\n（来源：新智元）\n新智元报道\nAI教师已经可以完成不少单次教学任务。\n一道数学题，它能拆解步骤；一篇英文作文，它能指出语法问题；一盘棋，它也能讲出下一步思路。很多场景里，模型输出已经足够像一位耐心助教。\n但教学效果不能只看教师端。学生听完之后有没有改正错误，是否只是照着提示走，同一句讲解对不同学生是否产生不同效果，这些都发生在学生端。\nAI教师如果要学习个性化指导，也需要反复观察学生反应。\n现实里，这些反应主要来自human study。每次调整教学策略，都要组织学生参与，收集交互，再由人工评估。\nAI模型可以快速更新，但教育反馈的获取速度受human study实验周期限制。\nAI tutor需要学生反馈来改进教学，但真实反馈采集成本较高。StudentSim希望把真实学生记录转化为训练阶段可反复调用的代理反馈。\n近期研究StudentSim，从这个矛盾出发。\n研究团队希望提升AI教师，使其理解学生优劣势，并根据不同学生给出合适指导。推进过程中，团队把问题落到学生模拟器上：能否用真实学生数据训练出可评估、可复用的AI学生，让AI教师在训练阶段获得更多反馈。\n论文链接： https://arxiv.org/abs/2609.01591\n代码链接：https://github.com/microsoft/StudentSim\nHuggingface Paper主页：https://huggingface.co/papers/2609.01591\n这件事放在今天的AI agent研究里并不孤立。User simulator正在成为热门的研究方向，进入客服、电商、医疗问诊、网页操作等场景。研究者会构造模拟用户，让agent在上线前经历更多交互，测试策略、话术和鲁棒性。\n教育场景里的用户模拟更复杂。学生有相对稳定的知识边界、错误习惯和学习轨迹。同一道题，有人会算错符号，有人会误解概念，有人听完提示后可以自己推到答案，有人需要更直接的指导。\n近来被讨论的人类学生数字孪生，也正是围绕这类需求展开。\n建模学生并不是新题目\n从1995年的贝叶斯知识追踪，到深度知识追踪、再到注意力知识追踪，这条方向已经被前人探索了近30年，在拟合学生行为上相当成熟。\n它们的共同缺口在于，模型只接受题目、状态、能力值这类结构化输入，没有一个接收自然语言指导的入口。无论教师说了什么，这类模型无法交互作出像学生一样的表现改变。\n如果直接让大模型扮演学生，看起来很方便。给它写一句「你是一个数学基础薄弱的小学生」，模型可以立刻换成低龄学生口吻，也能表现出犹豫和不确定。\n可是，角色语气和认知水平并不同步。\n一个模型可以用小学生口吻回答「我不太懂」，下一句却给出微积分级别的推理。它看起来在扮演学生，实际反馈仍然受模型自身知识储备影响，可能远远高于它被限制拥有的知识水平。\n用于AI教师训练时，这种认知水平偏差会带来问题。Tutor得到的不是某个学生在当前能力边界下的反应，而是一个高能力模型经过人设包装后的反应。\n也正是因为这样，仅靠一段能力描述做条件，对大模型来说，是一条很脆弱的条件通道。这条路线近两年被大量套用到教育场景，对话辅导语料、多智能体课堂、学习者数据生成都在用；与此同时，一批专门检验其效度的研究也在出现，从架构、保真度基准、教师使用体验三个角度提出质疑。\n教育学中，评价一次指导是否有效，通常不能只看学生独立作答时的表现，也要看学生在接受帮助后能走多远。\nVygotsky提出的最近发展区（zone of proximal development）讨论的就是这件事：学生当前能独立完成什么，和在教师支持下能够完成什么，中间的差距反映了教学可以介入的空间。\n这一想法后来被动态评估（dynamic assessment）落为可操作的测量程序：不只记录学生答对与否，还要在给出提示后观察他的表现如何移动。\n放到学生模拟器上，这个思想对应两类能力。\n第一，模拟器要能复现学生独立作答时的状态，包括能力边界、错误习惯和常见选择。第二，模拟器要能在读到教师指导后产生相应变化，表现出这个学生在帮助下可能出现的更新。\nStudentSim\nStudentSim把这两类能力分别定义为behavioral fidelity和guidance responsiveness，并据此训练和评估个性化学生模拟器。\n学生模拟器需要同时回答两个问题：独立作答时是否像目标学生，接受教师指导后是否产生相应变化。\n训练流程分为两步。\n第一步汇总一个领域内多名学生记录，训练通用学生行为模型。这个阶段学习共性错误、回答格式、指导后的修正路径。\n第二步使用单个学生自己的记录继续训练，得到个性化模拟器。单名学生记录少，直接训练容易过拟合；先学习群体规律，再适配个人数据，可以更稳定地获得每位学生对应的模拟器。\n训练流程\n研究团队同时构建StudentSimEval。评估覆盖60位真实学生，来自国际象棋、第二语言英语写作和基础数学三个场景。\n国际象棋中，模拟器要预测某位玩家在棋局中的走法，并在教练指导后改走位。二语写作中，模拟器要生成符合学习者错误模式的作文，并根据教师批改改写片段。数学中，模拟器要预测学生答案，并在讲解后修正。\n这些任务表面差异很大，评估目标保持一致：先看模拟器是否像学生本人，再看它能否响应指导。所有方法拿到同一份学生记录，在相同held-out测试记录上比较。\n国际象棋结果中，StudentSim的F为0.5150，R为0.9067；GPT-5.4分别为0.2316和0.7186；Maia2分别为0.4535和0.2721。二语写作和数学实验中，StudentSim也在两个指标上超过对应基线。\n国际象棋评测中的二维结果。GPT-5.4响应指导较好，但行为保真较低；Maia2更贴近棋手走法，但缺少自然语言指导入口；StudentSim位于两项指标同时较高的位置。\n这组结果呈现出清晰分工。GPT-5.4能阅读指导，模拟具体学生时保真不足。Maia2更贴近人类棋手走法，无法吸收自然语言教练提示。StudentSim通过真实学习记录训练，并对每位学生进行适配，在个体行为和指导响应两方面同时获得提升。\n不过学生模拟器本身不是目的，终点是，它的功用需要能落地到现实世界，能被用来改进教师模型。\n以往训练AI tutor，奖励信号在一些工作中来自专家标注的优质辅导对话，另外一些来自使用评分量表的通用大模型裁判。也有工作尝试把奖励接到模拟学生上，但采用的都是认知水平并不保真的角色扮演的LLM学生，而不是在真实学习者数据上训练过的模拟器。StudentSim在这一点上提出了不同的做法。\n论文进一步把StudentSim放入AItutor强化学习流程。\n实验场景为国际象棋。系统先取出真实学生犯过的错误走法，AI tutor生成指导，StudentSim读完指导后给出修正走法。\nStockfish用于计算修正走法相对原错误走法的质量变化，这个分数回传给tutor作为RL信号。对照组包括无RL的tutor，以及使用GPT-5.4作为学生模拟器reward的tutor。\nTutor生成指导，冻结的AI学生模拟器给出修正答案，系统根据修正前后的质量变化更新tutor。\n三组tutor使用相同基础模型、SFT起点和GRPO设置，reward来源不同。\n国际象棋评估者进行盲评后，StudentSim reward训练出的tutor在准确性、指导质量和个性化评分上均排在第一。\n专家在打乱呈现顺序的条件下盲评三个维度：准确性看「没有误导性事实错误」的回答占比，指导质量和个性化各为1到5分。StudentSim reward训练出的tutor在三个维度上均排第一。\n更值得注意的是结果反向的一组实验：用GPT-5.4当学生模拟器训出来的tutor，准确性不仅输给StudentSim，还低于完全没做RL的基线，拖后腿的是明显更高的严重事实错误率。模拟器不保真，会把教师往错的方向推：一个认知水平不符合真实学生、但理解能力超强的模拟器，读完再离谱的指导也能自己推出某种答案，于是给错误指导发了随机奖励，RL就朝着混乱（甚至错误）的方向优化。\nStudentSim没有把真实学生实验从教育研究中取代。它把真实学生记录转化成训练阶段可反复调用的模拟反馈，使AI tutor在进入human study前完成更多轮筛选和优化。\n对于需要个性化反馈的AI教师系统，这类学生模拟器、延续着近期热门的用户模拟器的思想脉络（一切人都可以模拟，建造人类的数字孪生），提供了一条颠覆性的工程路径：\n学习学生如何出错，学习学生如何在指导下改变，为教师模型的强化学习提供机器学习时间尺度的反馈信号。\n参考资料：\nhttps://arxiv.org/abs/2609.01591\n编辑：LRST","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-10/detail-inirihny3018910.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 3670 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3670 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3670,"summary_length":3670,"usable_text_length":3670,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3670,"summary_length":3670}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}