能力雷达图(14 维)
5 分 = 该领域当前第一梯队。分数来自官方文档与更新日志、公开的第三方基准,以及使用者反馈的综合判断,本站不做自建评测,也不是厂商宣传语。每个分数的依据见下方说明。
输出以转写稿与要点整理为主,独立成文的长文写作不是它的设计目标
官方支持长音频与长视频文件的转写与总结,一两小时的课堂或会议属常见处理量级
摘要基于转写文本归纳,说出内容意味着什么需要人判断,多步分析不是它的强项
不做数理计算,听写内容里的符号与公式也不会做推导
不写代码
不联网检索,没有来源标注机制,只处理你上传的录音与文件
转写、纪要、待办、字幕是一条固定流水线,跨系统自动执行能力有限
能做说话时长等简单统计,复杂数据分析与图表需外部工具
纪要与摘要可导出为 Word、PDF 与字幕文件,演示文稿仍需另做
不生成图片
可对视频画面做内容识别与描述,画面级细节与文字识别精度有限
能处理与理解视频内容,完全不生成视频
核心能力就是语音转写与实时听写,中文与多语种识别是官方主推方向
支持实时听写与边听边出稿,实时场景是它的主要使用方式
展开全部维度分数与打分依据(文字版)
输出以转写稿与要点整理为主,独立成文的长文写作不是它的设计目标
官方支持长音频与长视频文件的转写与总结,一两小时的课堂或会议属常见处理量级
摘要基于转写文本归纳,说出内容意味着什么需要人判断,多步分析不是它的强项
不做数理计算,听写内容里的符号与公式也不会做推导
不写代码
不联网检索,没有来源标注机制,只处理你上传的录音与文件
转写、纪要、待办、字幕是一条固定流水线,跨系统自动执行能力有限
能做说话时长等简单统计,复杂数据分析与图表需外部工具
纪要与摘要可导出为 Word、PDF 与字幕文件,演示文稿仍需另做
不生成图片
可对视频画面做内容识别与描述,画面级细节与文字识别精度有限
能处理与理解视频内容,完全不生成视频
核心能力就是语音转写与实时听写,中文与多语种识别是官方主推方向
支持实时听写与边听边出稿,实时场景是它的主要使用方式
它最强的地方
下面 3 个维度拿到 4 分以上,这是它真正值得优先考虑的依据。
- 长文理解4
依据:官方支持长音频与长视频文件的转写与总结,一两小时的课堂或会议属常见处理量级
- 语音音乐4
依据:核心能力就是语音转写与实时听写,中文与多语种识别是官方主推方向
- 实时交互4
依据:支持实时听写与边听边出稿,实时场景是它的主要使用方式
最适合这些场景
- 录课与听课:把课堂录音转成文字稿,再归纳教学环节与时间分配
- 听评课与教研:多人发言转写后按说话人拆开,看课堂互动结构
- 家长会与各类会议:整理成要点与待办,避免漏掉某一方的承诺
明确的短板与不适用场景
- 数理计算 仅 0 分
- 编程开发 仅 0 分
- 图像生成 仅 0 分
- 联网研究 仅 1 分
- 数据分析 仅 1 分
- 视频生成 仅 1 分
- 逻辑推理 仅 2 分
- 任务自动化 仅 2 分
它最强的地方
- 中文连续说话的识别在国产工具里靠前,会议与课堂这种整段发言基本能直接用
- 说话人区分做得清楚:谁的哪句话被标出来,听评课和访谈整理时省掉大量时间
- 一次录音同时给出文字、要点、待办与思维导图,不用再让别的模型重读一遍原文
- 支持导出 Word、PDF 与字幕文件,转写结果能直接进学校既有的文档流程
- 国内直连,个人使用免费额度对教师日常够用,上传课堂录音没有额外的合规顾虑
它的短板
- 多人抢话、背景噪音大的时候错误率明显上升,关键数字与人名必须人工核对
- 摘要只概括录音里说了什么,说不出这些内容对教学意味着什么
- 专业术语、方言和中英夹说的课堂容易转错,转写稿仍需逐段校订
- 生成的纪要与待办是初稿,要不要采纳、怎么排进教学安排,仍要老师自己判断
- 只能处理录音与文件,不能生成视频或音乐,也不做数理与编程类内容
别用它做
- 需要联网查证并逐条标注来源的调研工作:它只处理你上传的录音
- 录音条件无法保证准确率的场合直接出正式材料:错误会一路带到公文里
- 音视频创作与数理推理类任务:它不生成内容,也不做推导
价格与额度
| 计费模式 | 免费增值 |
|---|---|
| 免费额度 | 个人使用免费,长音频转写有免费时长额度 |
| 付费起步价 | 以官方定价页为准 |
| 备注 | 程序化调用要走阿里云的语音类接口,与网页端的功能范围并不完全对齐,接入前需先确认能拿到哪些能力 |
| 是否有 API | 有 |
| 支持平台 | 网页、iOS、Android、Windows、macOS、API |
价格随时可能调整,本页数据更新于 2026 年 9 月 29 日,请以官方页面为准。
上手三步
- 1注册与准备用 个人使用免费,长音频转写有免费时长额度 就能开始,不需要先付费。注册时建议绑定手机号,登录更稳定。
- 2第一次别只发「你好」,直接给一个真实任务把下面的提示词模板复制过去,先跑一个你自己今天就要用的任务。第一次就用真实素材,比用「帮我写首诗」更能判断它合不合手。
- 3最可能踩的坑:多人抢话、背景噪音大的时候错误率明显上升,关键数字与人名必须人工核对遇到不对的输出,先补背景和约束,而不是只说「不对,重写」。详见坏提示词对照表。
用它可以直接复制的提示词
模板来自站内教程与案例库,替换变量即可使用。
周报 / 工作汇报:从散乱记录到可直接提交
把一周的零散工作记录整理成结构化周报
你是一位有十年经验的团队负责人,帮我把下面这份"一周流水账"整理成一份可以直接发给主管的周报。
要求:
1. 结构固定为四段:【本周完成】(按重要性排序,最多 5 条,每条一句话讲清"做了什么 + 带来什么结果")【进行中】(写明卡点和需要谁配合)【下周计划】(不超过 3 条)【风险提示】(没有就写"无")
2. 不要出现"积极推进""持续优化"这类空话,每条都要有具体动作或数字
3. 语气克制、不自我评价式夸张,不使用表情符号
4. 全文控制在 400 字以内
5. 如果原始记录里缺少某段需要的信息,用【待补充:xxx】标出来,不要替我编
我的岗位:{{role}}
本周原始记录:
{{raw_notes}}
写完之后,另外给我 3 条"主管可能会追问的问题",以及每个问题我应该提前准备的材料。还有 2 个变量未填写,未填写的部分会原样保留 {{变量名}}
使用提示:国产模型(豆包、DeepSeek、Kimi)把原始记录贴全一些效果更好;海外模型对"待补充"这类约束执行得更严格,不会自行编数字。
长文档摘要:几百页 PDF 也能读出可用的结论
读一份很长的 PDF / 报告 / 合同,输出分层摘要与风险点
请阅读我上传的文档,输出一份"可执行摘要",不要复述原文。
结构要求:
1. 【一句话结论】:这份文档到底在讲什么、要求我做什么
2. 【关键数据】:最多 8 条,每条必须带原文出处(写明在第几页 / 第几条)
3. 【对我有影响的部分】:只写会改变我决策或行动的段落,并说明为什么
4. 【风险与不确定性】:文档里没写清楚、有歧义或自相矛盾的地方,逐条列出
5. 【我看漏了什么】:站在第一次接触这个主题的人角度,指出还需要补充哪些信息
约束:
- 每一条结论都必须能在原文里找到依据,找不到就标注【原文未见依据】
- 不要用"本文主要介绍了"这类空话开头
- 如果文档太长无法一次读完,请分段处理并告诉我分段方式
文档标题:{{doc_title}}
我的关注点:{{focus}}
文档内容:{{doc_content}}还有 3 个变量未填写,未填写的部分会原样保留 {{变量名}}
使用提示:Kimi 与 NotebookLM 对超长文档的切分处理更稳;Claude / Gemini 在"必须给出页码依据"上表现更好。上传文件优先于粘贴全文。
PPT 大纲:从一句话需求到可讲述的结构
把一个主题变成能讲 20 分钟的 PPT 大纲
帮我把下面这个主题做成一份可以直接讲 {{duration}} 分钟的 PPT 大纲。
我的主题:{{topic}}
听众:{{audience}}
听完我希望他们做的决定 / 记住的结论:{{goal}}
输出要求:
1. 先给一份"一句话主线",说清楚这份 PPT 的论证链条是什么
2. 再给每一页的清单,格式为:【页码】标题 / 这一页要传达的唯一信息 / 建议用什么图表或版式 / 讲这一页要花多久
3. 页数控制在 {{page_count}} 页左右,其中"结论页"必须放在最后
4. 明确标出哪些页可以删(我时间不够时先砍哪几页)
5. 最后给"讲述时的三个转折点",即听众最容易走神的位置
不要输出具体文案,只要大纲和结构。还有 5 个变量未填写,未填写的部分会原样保留 {{变量名}}
使用提示:Gamma / 讯飞智文这类工具能把大纲直接转成成品文件;纯对话模型只给大纲,需要你再喂给 Gamma 完成排版。
替代品对比入口
没有哪个工具全场景通吃。选型前建议至少对比 2-4 个。
一次对比全部替代品评分怎么来的
依据覆盖 14/14本站不做自建评测(识别准确率取决于录音条件与说话人,无法在统一条件下复现各家闭源能力),因此这些分数来自三部分交叉整理:官方公开资料(通义听悟产品页与帮助文档)、产品实际能力边界、以及公开反馈中反复出现的一致倾向。语音与实时维度的高分依据明确:产品形态就是转写与听写,能力与维度一一对应,可核对性强。写作、推理、数理、编程、视频生成几个维度按「不具备」给 0-2 分,不做模糊处理。需要提醒的是:一段安静的办公室录音和一段嘈杂的教室录音不能相提并论,因此这里的分数反映的是「具备这类能力」,不反映「在你的场景里有多准」。学校落地前请先用自己的录音试一段,再决定是否推广。
展开 14 个维度的逐条依据
- 写作表达
- 3 / 5
- 输出以转写稿与要点整理为主,独立成文的长文写作不是它的设计目标
- 长文理解
- 4 / 5
- 官方支持长音频与长视频文件的转写与总结,一两小时的课堂或会议属常见处理量级
- 逻辑推理
- 2 / 5
- 摘要基于转写文本归纳,说出内容意味着什么需要人判断,多步分析不是它的强项
- 数理计算
- 0 / 5
- 不做数理计算,听写内容里的符号与公式也不会做推导
- 编程开发
- 0 / 5
- 不写代码
- 联网研究
- 1 / 5
- 不联网检索,没有来源标注机制,只处理你上传的录音与文件
- 任务自动化
- 2 / 5
- 转写、纪要、待办、字幕是一条固定流水线,跨系统自动执行能力有限
- 数据分析
- 1 / 5
- 能做说话时长等简单统计,复杂数据分析与图表需外部工具
- 办公产出
- 3 / 5
- 纪要与摘要可导出为 Word、PDF 与字幕文件,演示文稿仍需另做
- 图像生成
- 0 / 5
- 不生成图片
- 图像理解
- 3 / 5
- 可对视频画面做内容识别与描述,画面级细节与文字识别精度有限
- 视频生成
- 1 / 5
- 能处理与理解视频内容,完全不生成视频
- 语音音乐
- 4 / 5
- 核心能力就是语音转写与实时听写,中文与多语种识别是官方主推方向
- 实时交互
- 4 / 5
- 支持实时听写与边听边出稿,实时场景是它的主要使用方式
本页数据复核于 2026 年 9 月 29 日。如果你认为某条依据不成立或有更新, 请在 勘误入口 提交勘误 —— 依据被推翻比分数算错更需要纠正。
数据来源与更新时间
本页数据更新于 2026 年 9 月 29 日。如果你发现某条信息已经过时,请在 /about#errata 提交勘误。
- 会议转写
- 课堂录音
- 说话人区分
- 自动纪要
- 国内直连
- 导出文档
难度分级参考:入门 / 进阶 / 深入(本站教程体系用)。本页所有评分维度统一口径, 与 评分方法 一致。 相关概念可从 知识库 入手。