它是什么
把图片、扫描件、拍照件里的文字识别出来变成可复制、可检索的文本,多数「看图」功能都从这一步开始。
为什么重要
纸质试卷、手写通知、拍照的作业本要变成能查、能统计、能复用的材料,靠的就是这一步。老师的案头材料里,图片形态占了一大半。
打个比方
像给一张照片配一支看不见的笔:把上面的字一个个誊写下来,从此这张图片也能搜索和编辑了。
举个例子
把整页纸质试卷拍下来交给 Gemini 或豆包,只让它做两件事:按原样转成文字、标出看不清的地方,再自己核对分数栏,整理成电子版就省掉了逐字录入。
常见误解
误解:识别出来就一定准确。 事实:手写字、倾斜拍摄、低对比度和分栏排版最容易出错,关键数字必须人工核对。
误解:这就是完整的看图能力。 事实:认出文字只是读图的一部分,看懂示意图和图表里的关系还要靠模型本身的图像理解。
误解:数学公式和化学式也能直接转。 事实:这类符号结构复杂,常常要人工校正或补一句说明,不能直接拿去批改。
误解:照片里有敏感信息也没关系。 事实:含学生姓名和成绩的材料交给外部服务等于上传给第三方,事先要确认学校的规定。
延伸阅读(相关概念)
本页内容更新于 2026 年 9 月 29 日。概念条目会随模型能力变化而修订。