跳到主要内容
AI 能力图谱

语音合成

Text-to-Speech · 能力与形态

入门能力与形态数据更新于 2026 年 9 月 30 日

它是什么

把文字转换成接近人声的朗读输出,让文本材料从「能看」变成「能听」,主要用于提升可及性。

为什么重要

视力不佳的学生、需要在路上听通知的家长、需要低负担材料的一线教师,都能因此少一道坎。这是少数几个能直接写进无障碍方案的 AI 能力。

打个比方

像把文字稿交给一位普通话主播:不用重新写稿子,按一下播放就有了可以直接听的内容。

举个例子

把家长会通知、期末复习提纲先用文字定稿,确认没有歧义后再用豆包或通义千问转成语音,发给不便阅读的学生;音频作为讲义的补充材料分发,不能替代教师本人的讲授。

常见误解

  • 误解:念出来就等于录音员一样自然。 事实:多数合成语音在停顿、重音和长句处理上仍有明显机器感,正式场合通常还要后期调整。

  • 误解:可以直接拿来给学生补课。 事实:讲解中的逻辑重音和临场判断无法自动生成,音频只适合作为材料补充。

  • 误解:人名和公式念对了就没事。 事实:专有名词、符号和数字常被念错或跳过,发布前要逐段试听核对。

  • 误解:可以随便模仿某个人的音色。 事实:克隆他人音色涉及授权和声音权益,学校场景要先确认合规边界再动手。

延伸阅读(相关概念)

本页内容更新于 2026 年 9 月 30 日。概念条目会随模型能力变化而修订。