前置要求
- · 一份已脱敏的学生作业或错题记录(含知识点、题目、失分点,不含可识别到个人的信息)
- · 本学科的评分标准与知识点划分
- · 能接受「评分由人做、AI 只做归类与统计」这条前提
做完你会得到什么
四样可验收的产物:① 一份按知识点归好类的错因分布表,含每类的人数与占比;② 一份高频错因的集体讲评讲稿初稿,含三个学生最容易卡住的环节;③ 一份写明「哪些信息不许上传」的隐私红线清单,可直接贴进教研组规范;④ 一次 10% 抽样的归类核对结果,用来判断这张表能不能用。
分步骤操作
- 1
第 1 步:先划红线,再打开任何工具
- 做什么
- 批改材料是最容易踩合规红线的场景。动手前先把三条红线写下来:姓名、学号、班级加任何外部标识一律不上传;含学生具体错误表述的原文不上传到公开账号;最终分数与评语由人给出,AI 只出现在归类与统计环节。这三条要贴在工具旁边,而不是记在脑子里。
- 在哪做
- 教研组共享文档,工具使用之前先写
- 输入什么
- 默认这一批数据会离开你的电脑,先确认你接受这个前提再往下走
- 预期输出
- 一份三条的红线清单,全组认同
出错怎么办
如果学校不允许任何学生数据出内网,这一条就是硬约束:改用本地部署的工具,或者干脆不做,把批改流程换成纯人工统计。
- 2
第 2 步:脱敏到「同一个人无法被认出」的程度
- 做什么
- 把姓名换成编号(01、02、03),删掉班级、学校、头像、手写姓名等任何可识别信息;错误的表述可以保留,但要抹掉能反推身份的细节(具体的家庭情况、同学姓名)。脱敏后的样本仍然要能看出题目和失分点。
- 在哪做
- 本地表格,先改字段名再删内容
- 输入什么
- 字段:题号 / 知识点 / 失分步骤 / 错误类型 / 学生编号
- 预期输出
- 一份无法回溯到具体学生的表格
出错怎么办
如果一份材料脱敏后就看不出错在哪,说明原记录太笼统,这时补录失分步骤比继续脱敏更有价值。
- 3
第 3 步:只让它归类,不让它打分
- 做什么
- 提示词里必须写死两条:你不负责给分,也不评价学生;你的任务是把这批错误按知识点和错误类型归类,并统计分布。明确划掉评分权,是为了避免它顺手写出「建议给 12 分」这类内容被误当成结论。
- 在哪做
- 支持长文档上传的对话模型;敏感度高时用本地部署的模型
- 输入什么
- 使用「错因归类」模板,填入 {{subject}}、{{knowledge_points}}、{{sample_records}}
- 预期输出
- 按知识点与错误类型分组的分布表,每组标注人次与占比
出错怎么办
如果它开始评价学生或给出分数,立刻追问「只做归类与统计,删掉所有关于学生水平的评价」,这一句要固定写进模板。
- 4
第 4 步:抽 10% 回来核对,不要全信
- 做什么
- 随机抽 10% 的记录,把 AI 归的类和自己判的类逐条比对,算出归类一致率。低于八成说明分类维度定义得不够清楚(常见原因是「错误类型」列同时混进了知识性错误和习惯性错误),需要先拆成两列再重跑一遍。
- 在哪做
- 本地表格,把抽样记录单独拉出来
- 输入什么
- 抽样 10%,逐条记录「AI 归类 / 我的归类 / 是否一致」
- 预期输出
- 一个一致率数字,以及不一致的条目清单
出错怎么办
如果一致率低但两类分布看着都合理,多半是粒度问题:先约定好每个类别的判定标准,再重跑,不要靠反复追问凑答案。
- 5
第 5 步:把最高频的两类变成集体讲评
- 做什么
- 从分布表里选占比最高的两类,各写一段集体讲评:这类错在第几步、正确的思路是什么、课堂上可以加一个什么小练习。把讲评稿念一遍,检查有没有出现「粗心」这类没有教学动作的建议。
- 在哪做
- 同一个对话,要求按「错在第几步 / 正确思路 / 课堂动作」三段输出
- 预期输出
- 两段讲评稿,每段都能对应到一个具体的课堂动作
出错怎么办
如果输出里全是「加强审题」「认真检查」,追问一句:这两句话学生在课上具体要做什么?答不上来的建议就删掉。
可复制的提示词
填好变量再复制。变量说明写在每个输入框下面。
错因归类与分布统计(不给分)
作业与试卷批改后的错因整理
我会给你一批已经脱敏的学生作答记录。你的任务只有归类与统计,不要打分,也不要评价学生。
学科与年级:{{subject}}
知识点划分:{{knowledge_points}}
错误类型只允许用这几类,不要自创:
- 概念不清(不知道规则或定义)
- 步骤缺失(会做但漏了一步)
- 审题偏差(看错了条件或问法)
- 运算失误(会做但算错)
- 表达不规范(会做但写不清楚)
原始记录:
{{sample_records}}
请按顺序输出:
1.【分布表】按知识点分组,每组给出错误人次、占比、这一组最常见的错误类型
2.【交叉观察】同一个错误类型集中在哪两个知识点上,说明这个集中意味着什么
3.【讲评建议】只针对占比最高的两类,各给「错在第几步 / 正确思路 / 课堂上可加的一个小练习」三段
4.【需要我确认的地方】你归类时拿不准的记录,逐条列出并说明为什么拿不准
严格遵守:不打分、不排名、不评价学生能力、不给鼓励或批评性评价。
所有占比只依据我给的记录计算,记录里没有的信息一律标【待确认】,不要推断。还有 3 个变量未填写,未填写的部分会原样保留 {{变量名}}
使用提示:这套模板刻意把「错误类型」限定成五类并禁止自创,因为自创类别会让后面的统计失去可比性。若工具开始输出「建议给几分」,一律追问回去:只做归类与统计。
本教程用到的工具
下一步学什么
本教程更新于 2026 年 9 月 29 日。提示词在不同模型上的表现会有差异, 遇到跑偏先检查「背景」和「约束」两段有没有写清楚。