关于本站:我们怎么打分,为什么你该信我们
一个工具推荐站最容易做的事是把所有工具都夸一遍。我们选择反过来:把弱项、避坑、数据来源摊开写。
全站数据更新于 2026-09-30
三条产品原则
1. 可决策
任何一页都要能回答「所以我现在该用哪个工具」。只介绍知识不给结论的页面,我们不做。
2. 有时效
所有数据都带更新时间与来源链接,页面显式展示「数据更新于 X 年 X 月」,超过 90 天未复核会标黄提醒。
3. 不吹不黑
每个工具必须写「强项」「弱项」「别用它做」。这一栏是本站唯一的信任来源,也是我们花时间最多的地方。
我们怎么打分
全站统一 14 个能力维度,每个维度 0-5 分。每个 ≥4 分或 ≤2 分的维度都必须写「打分依据」, 写不出来的分数我们不给。
分数含义
| 分数 | 含义 |
|---|---|
| 5 分 | 当前该领域的第一梯队,可直接用于生产场景 |
| 4 分 | 明显强于平均水平,有明确优势场景 |
| 3 分 | 够用,不出错但没有优势 |
| 2 分 | 能力弱或经常出错,需要人工兜底 |
| 1 分 | 基本不具备该能力 |
| 0 分 | 完全不提供该能力 |
14 个维度与综合分权重
| 维度 | 说明 | 综合分权重 |
|---|---|---|
| 写作表达 | 文案、改写、润色、多语言 | 1.2 |
| 长文理解 | 长文档 / 多文件阅读与总结 | 1 |
| 逻辑推理 | 复杂问题拆解、分析 | 1.2 |
| 数理计算 | 数学、物理、公式推导 | 0.8 |
| 编程开发 | 写码、调试、重构 | 1.2 |
| 联网研究 | 检索、溯源、带引用的调研 | 0.9 |
| 任务自动化 | 多步执行、工具调用、流程编排 | 0.9 |
| 数据分析 | 表格处理、图表、SQL | 0.9 |
| 办公产出 | Word / PPT / Excel 直接交付 | 0.9 |
| 图像生成 | 文生图、改图 | 0.6 |
| 图像理解 | 识图、OCR、截图理解 | 0.6 |
| 视频生成 | 文生视频、图生视频、剪辑 | 0.5 |
| 语音音乐 | TTS、语音克隆、音乐生成 | 0.5 |
| 实时交互 | 低延迟语音对话、同传 | 0.5 |
综合分 = Σ(维度分 × 权重) ÷ Σ(权重),结果保留两位小数。 写作 / 逻辑推理 / 编程略微加权(1.2),图像 / 视频 / 语音 / 实时降低权重(0.5-0.6), 因为它们对「通用生产力」的贡献远小于分数看起来的差异。综合分在数据文件中不手填,由代码计算。
打分依据从哪来
- · 官方基准测试:厂商公开的评测结果。我们会注明是哪个测试集,因为不同测试集的难度差异很大。
- · 我们自己的实测:用固定的测试任务跑一遍,记录典型失败模式。这条最费时间,也最值钱。
- · 社区共识:开发者社区里反复出现的评价。我们会标注「社区反馈」,不把它包装成客观测试。
我们不会编造没核实过的分数与价格。不确定的地方标 TODO: verify, 并在页面上如实写出「可能已过时」。
场景决策器怎么算
决策器不是大模型,是一个纯规则引擎,跑在你自己的浏览器里:
- 1. 取场景的权重表(例如「读长文档」:长文理解 0.35、联网研究 0.25、逻辑推理 0.20……), 归一化到总和为 1。
- 2. 每个工具在这个场景下的基础分 = Σ(该维度得分 / 5 × 权重) × 5,结果落在 0-5 之间。
- 3. 硬性条件直接剔除工具:「必须免费」「大陆可直连」不满足的出局;场景的硬门槛维度 (如图像生成场景要求 imageGen ≥ 3)不满足的出局。
- 4. 其余条件加减分,单项调整幅度上限 ±1.2 分,避免某个条件把排序完全带偏。
- 5. 排序取前三:首选 + 两个备选;结果里同时给出命中的维度、加分与扣分原因,保证可解释。
权重表在 决策器页面底部 公开。如果你觉得某个场景的权重不合理,欢迎提勘误。 当前共 10 个场景规则。
已知局限,先说清楚
- · 数据不是实时的。本站是人工维护的静态站,更新频率跟着我们的复核节奏走, 最多可能滞后一两个月。所有页面都标注更新时间。
- · 评分是主观的。我们的判断基于公开信息和有限实测, 不是实验室级评测。遇到重要选型,请以你自己的测试为准。
- · 收录是有选择的。22 个工具是筛选后的结果, 不是「市面上所有 AI 工具」。
- · 不接入任何厂商 API。本站所有功能都能纯静态运行, 好处是零成本、可离线;坏处是我们不能替你实测最新的模型版本。
- · 案例结果是编辑整理,不同团队的实际情况会差很多,案例页里的数字请当作参考量级。
勘误入口
发现数据过时、评分不合理、链接失效?告诉我们,我们会在 7 天内复核并更新, 同时在 更新雷达 里留下记录(包含你的指正)。
提交勘误时,请包含这三项
- 1. 页面 URL(例如 /tools/xxx)
- 2. 哪一条信息不对,以及你看到的最新信息(附来源链接更好)
- 3. 你是什么时候发现的(用于判断我们漏更了多久)
发邮件提交勘误邮箱地址为占位示例,站点正式上线前需替换
常见问题
- 分数是谁打的?会不会有主观成分?
- 是编辑打分,一定有主观成分,所以我们把打分依据和权重全部公开:任何 ≥4 分或 ≤2 分的维度都必须写明依据(官方基准测试 / 我们自己的实测 / 社区共识)。你可以直接质疑某一条,我们会把你的质疑和我们的修正一起写进更新雷达。
- 为什么综合分不等于「最好的工具」?
- 综合分是 14 个维度的加权平均,用来看一个工具的「全能程度」。真实选型几乎都是单维度的:你要写代码就只看编程维度,你要做图就只看图像生成维度。所以我们更推荐用场景决策器,它按场景权重算分,比综合分更贴近你的需求。
- 为什么不收录一些小众工具?
- 收录标准是:中文用户能在 30 分钟内上手、有一个清晰的官网或文档、能力边界说得清。做不到这三条的,即使很强也先不收 —— 否则站点会变成没人维护的工具大全。
- 为什么不做一个能直接对话的 AI?
- 本站的定位是「帮你选工具、教你方法」,不是「替代工具」。我们做的是决策和教学:让你去用对工具,而不是让你留在我们这儿。
- 价格数据准吗?
- 价格会变,所以我们只给大致的量级并附官方链接。任何价格都以厂商官网为准。数据超过 90 天没复核的页面会显示「可能已过时」。