它是什么
把文字转换成接近人声的朗读输出,让文本材料从「能看」变成「能听」,主要用于提升可及性。
为什么重要
视力不佳的学生、需要在路上听通知的家长、需要低负担材料的一线教师,都能因此少一道坎。这是少数几个能直接写进无障碍方案的 AI 能力。
打个比方
像把文字稿交给一位普通话主播:不用重新写稿子,按一下播放就有了可以直接听的内容。
举个例子
把家长会通知、期末复习提纲先用文字定稿,确认没有歧义后再用豆包或通义千问转成语音,发给不便阅读的学生;音频作为讲义的补充材料分发,不能替代教师本人的讲授。
常见误解
误解:念出来就等于录音员一样自然。 事实:多数合成语音在停顿、重音和长句处理上仍有明显机器感,正式场合通常还要后期调整。
误解:可以直接拿来给学生补课。 事实:讲解中的逻辑重音和临场判断无法自动生成,音频只适合作为材料补充。
误解:人名和公式念对了就没事。 事实:专有名词、符号和数字常被念错或跳过,发布前要逐段试听核对。
误解:可以随便模仿某个人的音色。 事实:克隆他人音色涉及授权和声音权益,学校场景要先确认合规边界再动手。
延伸阅读(相关概念)
本页内容更新于 2026 年 9 月 30 日。概念条目会随模型能力变化而修订。