教育AI指自适应练习推送、学情诊断画像、作文与口语自动批改等系统。本节审计它的成色:画像固化如何悄悄发生、自动批改的分数信度、以及教师在环路里应该握住什么。
自适应学习系统的日常:学生做一次诊断测验,系统给出一串知识点掌握度,之后几个月的练习推送都由这份画像驱动。问题在于画像会自我强化——系统判定某生"二次函数薄弱",于是推更多基础题,学生在这类题上耗尽时间,其他板块的练习量下降,下一次测验其他板块果然变弱,画像进一步"确诊"为全面薄弱。这个回路在推荐系统里叫反馈循环,在教育里它的名字更沉重:标签的自我实现。审计自适应产品,第一件事就是找它有没有打破回路的机制——定期引入画像之外的探索题、教师手动改画像的权限、跨知识块的强制轮换。
import random random.seed(61) class AdaptiveLoop: """演示画像固化:掌握度越低的板块获得越多练习,强者愈强。""" def __init__(self, topics): self.mastery = {t: 0.5 for t in topics} def week(self, explore=0.0): for t, m in self.mastery.items(): # 有 explore 概率推送"画像外"的探索题,打破回路 if random.random() < explore: gain = random.uniform(0.01, 0.03) # 探索题带来新鲜练习 else: gain = 0.02 * (1.0 - m) + 0.002 * m # 弱项练得多、涨得快 self.mastery[t] = min(self.mastery[t] + gain, 1.0) for explore in (0.0, 0.3): loop = AdaptiveLoop(["代数", "几何", "概率", "统计"]) loop.mastery["代数"] = 0.2 # 初始诊断:代数被判为薄弱 for _ in range(12): loop.week(explore=explore) spread = max(loop.mastery.values()) - min(loop.mastery.values()) print("探索率 %.0f%% -> 12周后掌握度极差 %.2f" % (explore*100, spread)) # 无探索时极差持续扩大:画像在制造它预言的差距。 # 打破回路不是玄学,是一个可配置的参数——审计时要问它的值是多少、谁定的。
自动批改的成色核心是信度:同一篇作文,机器给的分数与两位人工阅卷员平均分的吻合程度。公开宣传常报"与人工评分相关系数零点八几",审计要看三点。第一,相关系数高不等于个别误差可控——整体相关可以掩盖对某类文风(比如意识流开头、非常规结构作文)的系统性压分。第二,训练数据是谁批的:考务机构的双评数据和学生自评数据,含金量差几个等级。第三,也是最关键的:学生很快学会"骗"批改器——堆长句、塞高级词汇、套模板结构。任何只看表层特征的批改模型都会被应试策略攻陷,这是教育AI独有的对抗性漂移。
def essay_score_v1(length, fancy_words, structure_score): """示意:一个只看表层特征的批改器——容易被应试策略攻陷。""" return (0.4 * min(length / 800.0, 1.0) + 0.35 * min(fancy_words / 20.0, 1.0) + 0.25 * structure_score) # 两个策略:同样的内容空洞程度,第二篇只是更长、词更花、模板更齐 plain = essay_score_v1(length=420, fancy_words=3, structure_score=0.4) gamed = essay_score_v1(length=810, fancy_words=22, structure_score=1.0) print("朴素写作: %.2f 分 | 应试包装后: %.2f 分" % (plain, gamed)) # 分数差完全由表层特征贡献,内容质量一栏根本不存在于这个模型里。 # 成色好的批改系统必须给出"内容相关"的分项维度,且允许学生对分数申诉。
教育AI落地形态的分水岭:替代教师判断,还是放大教师判断。前者(全自动分班、全机器批改定档)在成色审计里几乎都不合格;后者(机器初筛加教师终审、教师可一键覆盖系统建议并留痕)是主流的好形态。教师覆盖率本身是个审计指标——系统上线一学期后,教师修改系统建议的比例如果趋近于零,要么系统极好,要么教师已经放弃阅读它,两种情况需要完全不同的处置。
教育AI独有一类数据问题:未成年人的行为数据。系统知道一个十二岁学生在哪个知识点卡了壳、几点睡觉前还在刷题、错题的情绪化放弃模式(连续三次秒答全错)。这些数据用于改进练习推送没有争议,但同一份数据流向招生机构或家长端"学情报告"的边界完全不同。审计教育项目的数据章节,不能只写"符合法规"四个字,要具体到:原始答题数据保存多久、谁能导出、家长端展示的是聚合结论还是过程明细。结论可以给,明细不出库,是条务实的底线。
这条底线在家长会场景里最容易失守:家长想看"孩子到底哪里弱",学校想让报告好看,两股力量都倾向于把过程数据做成精致的明细展示。守住底线的机构把家长端设计成结论加建议(薄弱板块加练习方案),把明细留给教研——展示什么本身就是数据治理决策,这一点值得写进任何教育AI的验收清单。
背景(一次考试定三个月的题)、操作(固化回路模拟、表层批改器演示)、结果(探索参数与信度三问)完整。解读:教育AI的成色不在推题多准,而在画像可修正、批改可申诉、教师覆盖有通道——误伤对象是学生的时间与自我认知,可逆性天然偏低。变式:企业培训的技能画像、招聘的简历筛选、健身App的训练计划都是同构的画像驱动系统,反馈回路检查法原样适用。下一节看一个误伤后果更物理、但兜底机制更成熟的现场:电网。