正确率 / 难度
说明样本、时间范围和是否包含重复作答,避免跨群体直接比较。
先定义要学会什么,再决定如何测、如何解释结果和如何干预。
明确行为与达标要求
知识点、难度与分值
客观题与表现性任务
口径、误差与限制
教师选择内容与策略
比较变化而非只看一次
说明样本、时间范围和是否包含重复作答,避免跨群体直接比较。
用于发现题目是否能区分不同表现群体,不能单独决定题目去留。
是基于知识点映射和作答规则的估计值,应公开计算口径和数据窗口。
受人群、题卷和标准影响,不能直接证明教学或AI带来的因果效果。
AI 输出需要来源、评分量规、抽样复核和版本留痕共同约束。
绑定目标和知识点,保留提示、模型版本、答案解析和教师修改记录。
先配置评分量规与要点;AI给建议得分,低置信度和抽样结果进入人工复核。
用代表性样本比较教师与AI结果,记录偏差,调整阈值后再扩大使用。
保留原作答、AI建议、教师结论和修改理由,最终责任归属人工角色。
建议可基于错题、知识点、时间窗口和练习历史生成;页面应显示推荐依据,教师可以增删、调整顺序或停用。
监考、限时、摄像头和自动评分策略应考虑网络条件、辅助技术和合理便利,避免把技术异常直接变成不利结论。