跳到主要内容
AI 能力图谱

通义听悟(Tongyi Tingwu)

把一堂课、一场会变成可检索的文字

阿里巴巴语音音乐办公文档中国大陆可直连数据更新于 2026 年 9 月 29 日依据覆盖 14/14

能力雷达图(14 维)

5 分 = 该领域当前第一梯队。分数来自官方文档与更新日志、公开的第三方基准,以及使用者反馈的综合判断,本站不做自建评测,也不是厂商宣传语。每个分数的依据见下方说明。

写作表达3/5

输出以转写稿与要点整理为主,独立成文的长文写作不是它的设计目标

长文理解4/5

官方支持长音频与长视频文件的转写与总结,一两小时的课堂或会议属常见处理量级

逻辑推理2/5

摘要基于转写文本归纳,说出内容意味着什么需要人判断,多步分析不是它的强项

数理计算0/5

不做数理计算,听写内容里的符号与公式也不会做推导

编程开发0/5

不写代码

联网研究1/5

不联网检索,没有来源标注机制,只处理你上传的录音与文件

任务自动化2/5

转写、纪要、待办、字幕是一条固定流水线,跨系统自动执行能力有限

数据分析1/5

能做说话时长等简单统计,复杂数据分析与图表需外部工具

办公产出3/5

纪要与摘要可导出为 Word、PDF 与字幕文件,演示文稿仍需另做

图像生成0/5

不生成图片

图像理解3/5

可对视频画面做内容识别与描述,画面级细节与文字识别精度有限

视频生成1/5

能处理与理解视频内容,完全不生成视频

语音音乐4/5

核心能力就是语音转写与实时听写,中文与多语种识别是官方主推方向

实时交互4/5

支持实时听写与边听边出稿,实时场景是它的主要使用方式

展开全部维度分数与打分依据(文字版)
写作表达3/5

输出以转写稿与要点整理为主,独立成文的长文写作不是它的设计目标

长文理解4/5

官方支持长音频与长视频文件的转写与总结,一两小时的课堂或会议属常见处理量级

逻辑推理2/5

摘要基于转写文本归纳,说出内容意味着什么需要人判断,多步分析不是它的强项

数理计算0/5

不做数理计算,听写内容里的符号与公式也不会做推导

编程开发0/5

不写代码

联网研究1/5

不联网检索,没有来源标注机制,只处理你上传的录音与文件

任务自动化2/5

转写、纪要、待办、字幕是一条固定流水线,跨系统自动执行能力有限

数据分析1/5

能做说话时长等简单统计,复杂数据分析与图表需外部工具

办公产出3/5

纪要与摘要可导出为 Word、PDF 与字幕文件,演示文稿仍需另做

图像生成0/5

不生成图片

图像理解3/5

可对视频画面做内容识别与描述,画面级细节与文字识别精度有限

视频生成1/5

能处理与理解视频内容,完全不生成视频

语音音乐4/5

核心能力就是语音转写与实时听写,中文与多语种识别是官方主推方向

实时交互4/5

支持实时听写与边听边出稿,实时场景是它的主要使用方式

它最强的地方

下面 3 个维度拿到 4 分以上,这是它真正值得优先考虑的依据。

  • 长文理解4

    依据:官方支持长音频与长视频文件的转写与总结,一两小时的课堂或会议属常见处理量级

  • 语音音乐4

    依据:核心能力就是语音转写与实时听写,中文与多语种识别是官方主推方向

  • 实时交互4

    依据:支持实时听写与边听边出稿,实时场景是它的主要使用方式

最适合这些场景

  • 录课与听课:把课堂录音转成文字稿,再归纳教学环节与时间分配
  • 听评课与教研:多人发言转写后按说话人拆开,看课堂互动结构
  • 家长会与各类会议:整理成要点与待办,避免漏掉某一方的承诺

明确的短板与不适用场景

  • 数理计算 仅 0 分
  • 编程开发 仅 0 分
  • 图像生成 仅 0 分
  • 联网研究 仅 1 分
  • 数据分析 仅 1 分
  • 视频生成 仅 1 分
  • 逻辑推理 仅 2 分
  • 任务自动化 仅 2 分

它最强的地方

  • 中文连续说话的识别在国产工具里靠前,会议与课堂这种整段发言基本能直接用
  • 说话人区分做得清楚:谁的哪句话被标出来,听评课和访谈整理时省掉大量时间
  • 一次录音同时给出文字、要点、待办与思维导图,不用再让别的模型重读一遍原文
  • 支持导出 Word、PDF 与字幕文件,转写结果能直接进学校既有的文档流程
  • 国内直连,个人使用免费额度对教师日常够用,上传课堂录音没有额外的合规顾虑

它的短板

  • 多人抢话、背景噪音大的时候错误率明显上升,关键数字与人名必须人工核对
  • 摘要只概括录音里说了什么,说不出这些内容对教学意味着什么
  • 专业术语、方言和中英夹说的课堂容易转错,转写稿仍需逐段校订
  • 生成的纪要与待办是初稿,要不要采纳、怎么排进教学安排,仍要老师自己判断
  • 只能处理录音与文件,不能生成视频或音乐,也不做数理与编程类内容

别用它做

  • 需要联网查证并逐条标注来源的调研工作:它只处理你上传的录音
  • 录音条件无法保证准确率的场合直接出正式材料:错误会一路带到公文里
  • 音视频创作与数理推理类任务:它不生成内容,也不做推导

价格与额度

通义听悟 价格与额度信息
计费模式免费增值
免费额度个人使用免费,长音频转写有免费时长额度
付费起步价以官方定价页为准
备注程序化调用要走阿里云的语音类接口,与网页端的功能范围并不完全对齐,接入前需先确认能拿到哪些能力
是否有 API有
支持平台网页、iOS、Android、Windows、macOS、API

价格随时可能调整,本页数据更新于 2026 年 9 月 29 日,请以官方页面为准。

上手三步

  1. 1注册与准备用 个人使用免费,长音频转写有免费时长额度 就能开始,不需要先付费。注册时建议绑定手机号,登录更稳定。
  2. 2第一次别只发「你好」,直接给一个真实任务把下面的提示词模板复制过去,先跑一个你自己今天就要用的任务。第一次就用真实素材,比用「帮我写首诗」更能判断它合不合手。
  3. 3最可能踩的坑:多人抢话、背景噪音大的时候错误率明显上升,关键数字与人名必须人工核对遇到不对的输出,先补背景和约束,而不是只说「不对,重写」。详见坏提示词对照表。

用它可以直接复制的提示词

模板来自站内教程与案例库,替换变量即可使用。

周报 / 工作汇报:从散乱记录到可直接提交

把一周的零散工作记录整理成结构化周报

打开工具
你是一位有十年经验的团队负责人,帮我把下面这份"一周流水账"整理成一份可以直接发给主管的周报。

要求:
1. 结构固定为四段:【本周完成】(按重要性排序,最多 5 条,每条一句话讲清"做了什么 + 带来什么结果")【进行中】(写明卡点和需要谁配合)【下周计划】(不超过 3 条)【风险提示】(没有就写"无")
2. 不要出现"积极推进""持续优化"这类空话,每条都要有具体动作或数字
3. 语气克制、不自我评价式夸张,不使用表情符号
4. 全文控制在 400 字以内
5. 如果原始记录里缺少某段需要的信息,用【待补充:xxx】标出来,不要替我编

我的岗位:{{role}}
本周原始记录:
{{raw_notes}}

写完之后,另外给我 3 条"主管可能会追问的问题",以及每个问题我应该提前准备的材料。

还有 2 个变量未填写,未填写的部分会原样保留 {{变量名}}

使用提示:国产模型(豆包、DeepSeek、Kimi)把原始记录贴全一些效果更好;海外模型对"待补充"这类约束执行得更严格,不会自行编数字。

长文档摘要:几百页 PDF 也能读出可用的结论

读一份很长的 PDF / 报告 / 合同,输出分层摘要与风险点

打开工具
请阅读我上传的文档,输出一份"可执行摘要",不要复述原文。

结构要求:
1. 【一句话结论】:这份文档到底在讲什么、要求我做什么
2. 【关键数据】:最多 8 条,每条必须带原文出处(写明在第几页 / 第几条)
3. 【对我有影响的部分】:只写会改变我决策或行动的段落,并说明为什么
4. 【风险与不确定性】:文档里没写清楚、有歧义或自相矛盾的地方,逐条列出
5. 【我看漏了什么】:站在第一次接触这个主题的人角度,指出还需要补充哪些信息

约束:
- 每一条结论都必须能在原文里找到依据,找不到就标注【原文未见依据】
- 不要用"本文主要介绍了"这类空话开头
- 如果文档太长无法一次读完,请分段处理并告诉我分段方式

文档标题:{{doc_title}}
我的关注点:{{focus}}
文档内容:{{doc_content}}

还有 3 个变量未填写,未填写的部分会原样保留 {{变量名}}

使用提示:Kimi 与 NotebookLM 对超长文档的切分处理更稳;Claude / Gemini 在"必须给出页码依据"上表现更好。上传文件优先于粘贴全文。

PPT 大纲:从一句话需求到可讲述的结构

把一个主题变成能讲 20 分钟的 PPT 大纲

打开工具
帮我把下面这个主题做成一份可以直接讲 {{duration}} 分钟的 PPT 大纲。

我的主题:{{topic}}
听众:{{audience}}
听完我希望他们做的决定 / 记住的结论:{{goal}}

输出要求:
1. 先给一份"一句话主线",说清楚这份 PPT 的论证链条是什么
2. 再给每一页的清单,格式为:【页码】标题 / 这一页要传达的唯一信息 / 建议用什么图表或版式 / 讲这一页要花多久
3. 页数控制在 {{page_count}} 页左右,其中"结论页"必须放在最后
4. 明确标出哪些页可以删(我时间不够时先砍哪几页)
5. 最后给"讲述时的三个转折点",即听众最容易走神的位置

不要输出具体文案,只要大纲和结构。

还有 5 个变量未填写,未填写的部分会原样保留 {{变量名}}

使用提示:Gamma / 讯飞智文这类工具能把大纲直接转成成品文件;纯对话模型只给大纲,需要你再喂给 Gamma 完成排版。

替代品对比入口

没有哪个工具全场景通吃。选型前建议至少对比 2-4 个。

一次对比全部替代品

评分怎么来的

依据覆盖 14/14

本站不做自建评测(识别准确率取决于录音条件与说话人,无法在统一条件下复现各家闭源能力),因此这些分数来自三部分交叉整理:官方公开资料(通义听悟产品页与帮助文档)、产品实际能力边界、以及公开反馈中反复出现的一致倾向。语音与实时维度的高分依据明确:产品形态就是转写与听写,能力与维度一一对应,可核对性强。写作、推理、数理、编程、视频生成几个维度按「不具备」给 0-2 分,不做模糊处理。需要提醒的是:一段安静的办公室录音和一段嘈杂的教室录音不能相提并论,因此这里的分数反映的是「具备这类能力」,不反映「在你的场景里有多准」。学校落地前请先用自己的录音试一段,再决定是否推广。

展开 14 个维度的逐条依据
写作表达
3 / 5
输出以转写稿与要点整理为主,独立成文的长文写作不是它的设计目标
长文理解
4 / 5
官方支持长音频与长视频文件的转写与总结,一两小时的课堂或会议属常见处理量级
逻辑推理
2 / 5
摘要基于转写文本归纳,说出内容意味着什么需要人判断,多步分析不是它的强项
数理计算
0 / 5
不做数理计算,听写内容里的符号与公式也不会做推导
编程开发
0 / 5
不写代码
联网研究
1 / 5
不联网检索,没有来源标注机制,只处理你上传的录音与文件
任务自动化
2 / 5
转写、纪要、待办、字幕是一条固定流水线,跨系统自动执行能力有限
数据分析
1 / 5
能做说话时长等简单统计,复杂数据分析与图表需外部工具
办公产出
3 / 5
纪要与摘要可导出为 Word、PDF 与字幕文件,演示文稿仍需另做
图像生成
0 / 5
不生成图片
图像理解
3 / 5
可对视频画面做内容识别与描述,画面级细节与文字识别精度有限
视频生成
1 / 5
能处理与理解视频内容,完全不生成视频
语音音乐
4 / 5
核心能力就是语音转写与实时听写,中文与多语种识别是官方主推方向
实时交互
4 / 5
支持实时听写与边听边出稿,实时场景是它的主要使用方式

本页数据复核于 2026 年 9 月 29 日。如果你认为某条依据不成立或有更新, 请在 勘误入口 提交勘误 —— 依据被推翻比分数算错更需要纠正。

数据来源与更新时间

本页数据更新于 2026 年 9 月 29 日。如果你发现某条信息已经过时,请在 /about#errata 提交勘误。

  • 会议转写
  • 课堂录音
  • 说话人区分
  • 自动纪要
  • 国内直连
  • 导出文档

难度分级参考:入门 / 进阶 / 深入(本站教程体系用)。本页所有评分维度统一口径, 与 评分方法 一致。 相关概念可从 知识库 入手。