跳到主要内容
AI 能力图谱

用 AI 做作业批改与错因归类:省时间,但不碰评分

AI 能做的是归类错因、统计分布、生成讲评建议,不能做的是给学生定分。这篇把这条界线怎么划、以及哪些信息不许上传,写清楚。

场景实操课进阶预计 35 分钟内容更新于 2026 年 9 月 29 日

前置要求

  • · 一份已脱敏的学生作业或错题记录(含知识点、题目、失分点,不含可识别到个人的信息)
  • · 本学科的评分标准与知识点划分
  • · 能接受「评分由人做、AI 只做归类与统计」这条前提

做完你会得到什么

四样可验收的产物:① 一份按知识点归好类的错因分布表,含每类的人数与占比;② 一份高频错因的集体讲评讲稿初稿,含三个学生最容易卡住的环节;③ 一份写明「哪些信息不许上传」的隐私红线清单,可直接贴进教研组规范;④ 一次 10% 抽样的归类核对结果,用来判断这张表能不能用。

分步骤操作

  1. 1

    第 1 步:先划红线,再打开任何工具

    做什么
    批改材料是最容易踩合规红线的场景。动手前先把三条红线写下来:姓名、学号、班级加任何外部标识一律不上传;含学生具体错误表述的原文不上传到公开账号;最终分数与评语由人给出,AI 只出现在归类与统计环节。这三条要贴在工具旁边,而不是记在脑子里。
    在哪做
    教研组共享文档,工具使用之前先写
    输入什么
    默认这一批数据会离开你的电脑,先确认你接受这个前提再往下走
    预期输出
    一份三条的红线清单,全组认同

    出错怎么办

    如果学校不允许任何学生数据出内网,这一条就是硬约束:改用本地部署的工具,或者干脆不做,把批改流程换成纯人工统计。

  2. 2

    第 2 步:脱敏到「同一个人无法被认出」的程度

    做什么
    把姓名换成编号(01、02、03),删掉班级、学校、头像、手写姓名等任何可识别信息;错误的表述可以保留,但要抹掉能反推身份的细节(具体的家庭情况、同学姓名)。脱敏后的样本仍然要能看出题目和失分点。
    在哪做
    本地表格,先改字段名再删内容
    输入什么
    字段:题号 / 知识点 / 失分步骤 / 错误类型 / 学生编号
    预期输出
    一份无法回溯到具体学生的表格

    出错怎么办

    如果一份材料脱敏后就看不出错在哪,说明原记录太笼统,这时补录失分步骤比继续脱敏更有价值。

  3. 3

    第 3 步:只让它归类,不让它打分

    做什么
    提示词里必须写死两条:你不负责给分,也不评价学生;你的任务是把这批错误按知识点和错误类型归类,并统计分布。明确划掉评分权,是为了避免它顺手写出「建议给 12 分」这类内容被误当成结论。
    在哪做
    支持长文档上传的对话模型;敏感度高时用本地部署的模型
    输入什么
    使用「错因归类」模板,填入 {{subject}}、{{knowledge_points}}、{{sample_records}}
    预期输出
    按知识点与错误类型分组的分布表,每组标注人次与占比

    出错怎么办

    如果它开始评价学生或给出分数,立刻追问「只做归类与统计,删掉所有关于学生水平的评价」,这一句要固定写进模板。

  4. 4

    第 4 步:抽 10% 回来核对,不要全信

    做什么
    随机抽 10% 的记录,把 AI 归的类和自己判的类逐条比对,算出归类一致率。低于八成说明分类维度定义得不够清楚(常见原因是「错误类型」列同时混进了知识性错误和习惯性错误),需要先拆成两列再重跑一遍。
    在哪做
    本地表格,把抽样记录单独拉出来
    输入什么
    抽样 10%,逐条记录「AI 归类 / 我的归类 / 是否一致」
    预期输出
    一个一致率数字,以及不一致的条目清单

    出错怎么办

    如果一致率低但两类分布看着都合理,多半是粒度问题:先约定好每个类别的判定标准,再重跑,不要靠反复追问凑答案。

  5. 5

    第 5 步:把最高频的两类变成集体讲评

    做什么
    从分布表里选占比最高的两类,各写一段集体讲评:这类错在第几步、正确的思路是什么、课堂上可以加一个什么小练习。把讲评稿念一遍,检查有没有出现「粗心」这类没有教学动作的建议。
    在哪做
    同一个对话,要求按「错在第几步 / 正确思路 / 课堂动作」三段输出
    预期输出
    两段讲评稿,每段都能对应到一个具体的课堂动作

    出错怎么办

    如果输出里全是「加强审题」「认真检查」,追问一句:这两句话学生在课上具体要做什么?答不上来的建议就删掉。

可复制的提示词

填好变量再复制。变量说明写在每个输入框下面。

错因归类与分布统计(不给分)

作业与试卷批改后的错因整理

打开工具
我会给你一批已经脱敏的学生作答记录。你的任务只有归类与统计,不要打分,也不要评价学生。

学科与年级:{{subject}}
知识点划分:{{knowledge_points}}
错误类型只允许用这几类,不要自创:
- 概念不清(不知道规则或定义)
- 步骤缺失(会做但漏了一步)
- 审题偏差(看错了条件或问法)
- 运算失误(会做但算错)
- 表达不规范(会做但写不清楚)

原始记录:
{{sample_records}}

请按顺序输出:
1.【分布表】按知识点分组,每组给出错误人次、占比、这一组最常见的错误类型
2.【交叉观察】同一个错误类型集中在哪两个知识点上,说明这个集中意味着什么
3.【讲评建议】只针对占比最高的两类,各给「错在第几步 / 正确思路 / 课堂上可加的一个小练习」三段
4.【需要我确认的地方】你归类时拿不准的记录,逐条列出并说明为什么拿不准

严格遵守:不打分、不排名、不评价学生能力、不给鼓励或批评性评价。
所有占比只依据我给的记录计算,记录里没有的信息一律标【待确认】,不要推断。

还有 3 个变量未填写,未填写的部分会原样保留 {{变量名}}

使用提示:这套模板刻意把「错误类型」限定成五类并禁止自创,因为自创类别会让后面的统计失去可比性。若工具开始输出「建议给几分」,一律追问回去:只做归类与统计。

本教程用到的工具

  • ChatGPT 标志
    ChatGPT

    最通用的基线,生态最厚

  • Kimi 标志
    Kimi

    长文档起家,检索是加分项

  • DeepSeek 标志
    DeepSeek

    推理性价比标杆,可完全自部署

  • Ollama 标志
    Ollama

    把开源模型拉到本机跑

下一步学什么

本教程更新于 2026 年 9 月 29 日。提示词在不同模型上的表现会有差异, 遇到跑偏先检查「背景」和「约束」两段有没有写清楚。