跳到主要内容
AI 能力图谱

关于本站:我们怎么打分,为什么你该信我们

一个工具推荐站最容易做的事是把所有工具都夸一遍。我们选择反过来:把弱项、避坑、数据来源摊开写。

全站数据更新于 2026-09-30

三条产品原则

  1. 1. 可决策

    任何一页都要能回答「所以我现在该用哪个工具」。只介绍知识不给结论的页面,我们不做。

  2. 2. 有时效

    所有数据都带更新时间与来源链接,页面显式展示「数据更新于 X 年 X 月」,超过 90 天未复核会标黄提醒。

  3. 3. 不吹不黑

    每个工具必须写「强项」「弱项」「别用它做」。这一栏是本站唯一的信任来源,也是我们花时间最多的地方。

我们怎么打分

全站统一 14 个能力维度,每个维度 0-5 分。每个 ≥4 分或 ≤2 分的维度都必须写「打分依据」, 写不出来的分数我们不给。

分数含义

分数含义
5 分当前该领域的第一梯队,可直接用于生产场景
4 分明显强于平均水平,有明确优势场景
3 分够用,不出错但没有优势
2 分能力弱或经常出错,需要人工兜底
1 分基本不具备该能力
0 分完全不提供该能力

14 个维度与综合分权重

维度说明综合分权重
写作表达文案、改写、润色、多语言1.2
长文理解长文档 / 多文件阅读与总结1
逻辑推理复杂问题拆解、分析1.2
数理计算数学、物理、公式推导0.8
编程开发写码、调试、重构1.2
联网研究检索、溯源、带引用的调研0.9
任务自动化多步执行、工具调用、流程编排0.9
数据分析表格处理、图表、SQL0.9
办公产出Word / PPT / Excel 直接交付0.9
图像生成文生图、改图0.6
图像理解识图、OCR、截图理解0.6
视频生成文生视频、图生视频、剪辑0.5
语音音乐TTS、语音克隆、音乐生成0.5
实时交互低延迟语音对话、同传0.5

综合分 = Σ(维度分 × 权重) ÷ Σ(权重),结果保留两位小数。 写作 / 逻辑推理 / 编程略微加权(1.2),图像 / 视频 / 语音 / 实时降低权重(0.5-0.6), 因为它们对「通用生产力」的贡献远小于分数看起来的差异。综合分在数据文件中不手填,由代码计算。

打分依据从哪来

  • · 官方基准测试:厂商公开的评测结果。我们会注明是哪个测试集,因为不同测试集的难度差异很大。
  • · 我们自己的实测:用固定的测试任务跑一遍,记录典型失败模式。这条最费时间,也最值钱。
  • · 社区共识:开发者社区里反复出现的评价。我们会标注「社区反馈」,不把它包装成客观测试。

我们不会编造没核实过的分数与价格。不确定的地方标 TODO: verify, 并在页面上如实写出「可能已过时」。

场景决策器怎么算

决策器不是大模型,是一个纯规则引擎,跑在你自己的浏览器里:

  1. 1. 取场景的权重表(例如「读长文档」:长文理解 0.35、联网研究 0.25、逻辑推理 0.20……), 归一化到总和为 1。
  2. 2. 每个工具在这个场景下的基础分 = Σ(该维度得分 / 5 × 权重) × 5,结果落在 0-5 之间。
  3. 3. 硬性条件直接剔除工具:「必须免费」「大陆可直连」不满足的出局;场景的硬门槛维度 (如图像生成场景要求 imageGen ≥ 3)不满足的出局。
  4. 4. 其余条件加减分,单项调整幅度上限 ±1.2 分,避免某个条件把排序完全带偏。
  5. 5. 排序取前三:首选 + 两个备选;结果里同时给出命中的维度、加分与扣分原因,保证可解释。

权重表在 决策器页面底部 公开。如果你觉得某个场景的权重不合理,欢迎提勘误。 当前共 10 个场景规则。

已知局限,先说清楚

  • · 数据不是实时的。本站是人工维护的静态站,更新频率跟着我们的复核节奏走, 最多可能滞后一两个月。所有页面都标注更新时间。
  • · 评分是主观的。我们的判断基于公开信息和有限实测, 不是实验室级评测。遇到重要选型,请以你自己的测试为准。
  • · 收录是有选择的。22 个工具是筛选后的结果, 不是「市面上所有 AI 工具」。
  • · 不接入任何厂商 API。本站所有功能都能纯静态运行, 好处是零成本、可离线;坏处是我们不能替你实测最新的模型版本。
  • · 案例结果是编辑整理,不同团队的实际情况会差很多,案例页里的数字请当作参考量级。

勘误入口

发现数据过时、评分不合理、链接失效?告诉我们,我们会在 7 天内复核并更新, 同时在 更新雷达 里留下记录(包含你的指正)。

提交勘误时,请包含这三项

  • 1. 页面 URL(例如 /tools/xxx)
  • 2. 哪一条信息不对,以及你看到的最新信息(附来源链接更好)
  • 3. 你是什么时候发现的(用于判断我们漏更了多久)
发邮件提交勘误邮箱地址为占位示例,站点正式上线前需替换

常见问题

分数是谁打的?会不会有主观成分?
是编辑打分,一定有主观成分,所以我们把打分依据和权重全部公开:任何 ≥4 分或 ≤2 分的维度都必须写明依据(官方基准测试 / 我们自己的实测 / 社区共识)。你可以直接质疑某一条,我们会把你的质疑和我们的修正一起写进更新雷达。
为什么综合分不等于「最好的工具」?
综合分是 14 个维度的加权平均,用来看一个工具的「全能程度」。真实选型几乎都是单维度的:你要写代码就只看编程维度,你要做图就只看图像生成维度。所以我们更推荐用场景决策器,它按场景权重算分,比综合分更贴近你的需求。
为什么不收录一些小众工具?
收录标准是:中文用户能在 30 分钟内上手、有一个清晰的官网或文档、能力边界说得清。做不到这三条的,即使很强也先不收 —— 否则站点会变成没人维护的工具大全。
为什么不做一个能直接对话的 AI?
本站的定位是「帮你选工具、教你方法」,不是「替代工具」。我们做的是决策和教学:让你去用对工具,而不是让你留在我们这儿。
价格数据准吗?
价格会变,所以我们只给大致的量级并附官方链接。任何价格都以厂商官网为准。数据超过 90 天没复核的页面会显示「可能已过时」。