能力雷达图(14 维)
5 分 = 该领域当前第一梯队。分数来自官方文档与更新日志、公开的第三方基准,以及使用者反馈的综合判断,本站不做自建评测,也不是厂商宣传语。每个分数的依据见下方说明。
写作圈长期反馈一致:结构稳、语气自然,长句不易崩,中文改写最不像机翻
200K 上下文加 Artifacts,长文档交叉比对与矛盾点标注是主打能力
扩展思考模式在复杂拆解任务上表现好,思维链长度受套餐限制
官方数学基准稳定在前列,能给出推导过程,符号题仍需人工校验
Claude Code 代理式编程长期处于 SWE-bench 第一梯队,代码风格干净
主产品不做联网检索,需自行接入 API 的 web search 工具或外部检索
Claude Code 加 MCP 与 Subagents,是当前代理式编程与工具调用最完整的一套
analysis 工具可在沙箱里跑 Python 处理数据并出图,不必手写代码
Artifacts 能出可交互页面与文档,Word / PPT 仍需导出转换
只能理解图片,不能生成图片,生图需另用工具
图表、扫描件与复杂截图解析的公开反馈较好,倾向把图里信息说清楚
可分析视频帧,但不生成视频
有语音模式但不是核心方向,音色定制与方言支持都一般
Realtime 能力在 API 侧可用,客户端实时通话的流畅度不如原生语音产品
展开全部维度分数与打分依据(文字版)
写作圈长期反馈一致:结构稳、语气自然,长句不易崩,中文改写最不像机翻
200K 上下文加 Artifacts,长文档交叉比对与矛盾点标注是主打能力
扩展思考模式在复杂拆解任务上表现好,思维链长度受套餐限制
官方数学基准稳定在前列,能给出推导过程,符号题仍需人工校验
Claude Code 代理式编程长期处于 SWE-bench 第一梯队,代码风格干净
主产品不做联网检索,需自行接入 API 的 web search 工具或外部检索
Claude Code 加 MCP 与 Subagents,是当前代理式编程与工具调用最完整的一套
analysis 工具可在沙箱里跑 Python 处理数据并出图,不必手写代码
Artifacts 能出可交互页面与文档,Word / PPT 仍需导出转换
只能理解图片,不能生成图片,生图需另用工具
图表、扫描件与复杂截图解析的公开反馈较好,倾向把图里信息说清楚
可分析视频帧,但不生成视频
有语音模式但不是核心方向,音色定制与方言支持都一般
Realtime 能力在 API 侧可用,客户端实时通话的流畅度不如原生语音产品
它最强的地方
下面 8 个维度拿到 4 分以上,这是它真正值得优先考虑的依据。
- 写作表达5
依据:写作圈长期反馈一致:结构稳、语气自然,长句不易崩,中文改写最不像机翻
- 长文理解5
依据:200K 上下文加 Artifacts,长文档交叉比对与矛盾点标注是主打能力
- 任务自动化5
依据:Claude Code 加 MCP 与 Subagents,是当前代理式编程与工具调用最完整的一套
- 逻辑推理4
依据:扩展思考模式在复杂拆解任务上表现好,思维链长度受套餐限制
- 数理计算4
依据:官方数学基准稳定在前列,能给出推导过程,符号题仍需人工校验
- 编程开发4
依据:Claude Code 代理式编程长期处于 SWE-bench 第一梯队,代码风格干净
- 数据分析4
依据:analysis 工具可在沙箱里跑 Python 处理数据并出图,不必手写代码
- 图像理解4
依据:图表、扫描件与复杂截图解析的公开反馈较好,倾向把图里信息说清楚
最适合这些场景
- 读长文档:合同、论文、财报、需求文档的分析与交叉核对
- 写代码与调代码,尤其是需要解释逻辑而不是只要能跑的场景
- 中文写作与改写,长文、稿件、公文类文本的润色
明确的短板与不适用场景
- 图像生成 仅 1 分
- 视频生成 仅 1 分
- 联网研究 仅 2 分
- 语音音乐 仅 2 分
它最强的地方
- 长文阅读是硬优势:几十页 PDF 丢进去,它会主动指出互相矛盾的数据而不是硬凑结论
- 代码可读性最好,生成的实现接近人类写法,注释也写得清楚
- 幻觉率在主流产品里偏低,不确定时会明说不确定,而不是编一个像模像样的答案
- Artifacts 可以把代码和文档直接变成可交互产物,不用自己复制粘贴
它的短板
- 主产品不做联网检索,问今天发生的事会停在训练数据上
- 不能生成图片、做 PPT 或导出 Word,交付环节仍需手工加工
- 国内无法直连,需要网络工具手段,团队协作时账号与合规是现实成本
- 免费额度比 ChatGPT 紧,重度使用会较快触顶
别用它做
- 需要全网检索并逐条标注来源的调研工作:默认离线,引用得自己接
- 要求一句话出图或出视频的创意工作:本产品没有生成能力
- 中国大陆团队需要全员直连、无需额外网络环境的场景
价格与额度
| 计费模式 | 免费增值 |
|---|---|
| 免费额度 | 免费版每天有限额度的对话 |
| 付费起步价 | 约 $20/月起(Pro) |
| 备注 | 团队与企业版按席位计价,额度策略逐年收紧,以官方页面为准 |
| 是否有 API | 有 |
| 支持平台 | 网页、iOS、Android、Windows、macOS、API、命令行 |
价格随时可能调整,本页数据更新于 2026 年 9 月 22 日,请以官方页面为准。
上手三步
- 1注册与准备用 免费版每天有限额度的对话 就能开始,不需要先付费。注意:在中国大陆通常需要可用的网络环境才能访问,注册前先确认这一点。
- 2第一次别只发「你好」,直接给一个真实任务把下面的提示词模板复制过去,先跑一个你自己今天就要用的任务。第一次就用真实素材,比用「帮我写首诗」更能判断它合不合手。
- 3最可能踩的坑:主产品不做联网检索,问今天发生的事会停在训练数据上遇到不对的输出,先补背景和约束,而不是只说「不对,重写」。详见坏提示词对照表。
用它可以直接复制的提示词
模板来自站内教程与案例库,替换变量即可使用。
长文档摘要:几百页 PDF 也能读出可用的结论
读一份很长的 PDF / 报告 / 合同,输出分层摘要与风险点
请阅读我上传的文档,输出一份"可执行摘要",不要复述原文。
结构要求:
1. 【一句话结论】:这份文档到底在讲什么、要求我做什么
2. 【关键数据】:最多 8 条,每条必须带原文出处(写明在第几页 / 第几条)
3. 【对我有影响的部分】:只写会改变我决策或行动的段落,并说明为什么
4. 【风险与不确定性】:文档里没写清楚、有歧义或自相矛盾的地方,逐条列出
5. 【我看漏了什么】:站在第一次接触这个主题的人角度,指出还需要补充哪些信息
约束:
- 每一条结论都必须能在原文里找到依据,找不到就标注【原文未见依据】
- 不要用"本文主要介绍了"这类空话开头
- 如果文档太长无法一次读完,请分段处理并告诉我分段方式
文档标题:{{doc_title}}
我的关注点:{{focus}}
文档内容:{{doc_content}}还有 3 个变量未填写,未填写的部分会原样保留 {{变量名}}
使用提示:Kimi 与 NotebookLM 对超长文档的切分处理更稳;Claude / Gemini 在"必须给出页码依据"上表现更好。上传文件优先于粘贴全文。
替代品对比入口
没有哪个工具全场景通吃。选型前建议至少对比 2-4 个。
一次对比全部替代品评分怎么来的
依据覆盖 14/14本站不做自建评测(无法在本地复现各家闭源模型),因此这些分数来自三部分交叉整理:官方公开资料(模型卡 / 产品文档 / 定价页 / 发布说明)、产品实际能力边界、以及社区公开反馈中反复出现的一致倾向。 Claude 的长文与代码高分,依据集中在官方对长上下文与代码生成能力的说明,以及社区在长文档一致性上的反复反馈。需要注意的是:主产品不做联网检索,检索类分数直接按「不具备」处理而不是给低分;换版本后长文档表现的公开反馈差异较大,建议以本页更新日期为参考。
展开 14 个维度的逐条依据
- 写作表达
- 5 / 5
- 写作圈长期反馈一致:结构稳、语气自然,长句不易崩,中文改写最不像机翻
- 长文理解
- 5 / 5
- 200K 上下文加 Artifacts,长文档交叉比对与矛盾点标注是主打能力
- 逻辑推理
- 4 / 5
- 扩展思考模式在复杂拆解任务上表现好,思维链长度受套餐限制
- 数理计算
- 4 / 5
- 官方数学基准稳定在前列,能给出推导过程,符号题仍需人工校验
- 编程开发
- 4 / 5
- Claude Code 代理式编程长期处于 SWE-bench 第一梯队,代码风格干净
- 联网研究
- 2 / 5
- 主产品不做联网检索,需自行接入 API 的 web search 工具或外部检索
- 任务自动化
- 5 / 5
- Claude Code 加 MCP 与 Subagents,是当前代理式编程与工具调用最完整的一套
- 数据分析
- 4 / 5
- analysis 工具可在沙箱里跑 Python 处理数据并出图,不必手写代码
- 办公产出
- 3 / 5
- Artifacts 能出可交互页面与文档,Word / PPT 仍需导出转换
- 图像生成
- 1 / 5
- 只能理解图片,不能生成图片,生图需另用工具
- 图像理解
- 4 / 5
- 图表、扫描件与复杂截图解析的公开反馈较好,倾向把图里信息说清楚
- 视频生成
- 1 / 5
- 可分析视频帧,但不生成视频
- 语音音乐
- 2 / 5
- 有语音模式但不是核心方向,音色定制与方言支持都一般
- 实时交互
- 3 / 5
- Realtime 能力在 API 侧可用,客户端实时通话的流畅度不如原生语音产品
本页数据复核于 2026 年 9 月 22 日。如果你认为某条依据不成立或有更新, 请在 勘误入口 提交勘误 —— 依据被推翻比分数算错更需要纠正。
数据来源与更新时间
本页数据更新于 2026 年 9 月 22 日。如果你发现某条信息已经过时,请在 /about#errata 提交勘误。
- 长文能力强
- 写作质量高
- 适合写代码
- 幻觉率低
- 生态专业
难度分级参考:入门 / 进阶 / 深入(本站教程体系用)。本页所有评分维度统一口径, 与 评分方法 一致。 相关概念可从 知识库 入手。