它是什么
用海量文本训练出的巨型神经网络,靠「看着上文预测下一个词」生成连贯自然的文字。
为什么重要
它决定了你手上工具的能力上限:能不能读长文档、写代码、做推理、看懂图表,根子上都来自同一套底层模型的强弱。
打个比方
像一位读过几百万本书、语言极好的通才:聊天时不必现查资料也能说出个大概,但具体的数字和法律条款未必记得准。
举个例子
在 Claude 里贴一份季度财报,问「把文中提到的三笔异常支出解释清楚」,模型会先读你给的内容再作答;在 ChatGPT 里让它写一段能跑通的 Python 脚本,走的是同一套底座。
常见误解
误解:大模型只是把互联网上的文本背了下来。 事实:它学到的是文本之间的关系与模式,并没有一份可检索的原文,所以会出现幻觉,而不是把原文抄错。
误解:模型越大就所有任务都做得更好。 事实:参数量只是能力上限之一,长文档处理、工具调用和事实准确度更多取决于训练投入与工程打磨。
误解:它就是搜索引擎。 事实:它默认不联网,回答来自参数里的记忆;要拿到最新信息,必须让它检索或调用外部工具。
误解:换个说法提问就会换一种「性格」。 事实:语气和风格的变化多半来自提示词与温度设置,不是模型本身换了人格。
延伸阅读(相关概念)
本页内容更新于 2026 年 9 月 2 日。概念条目会随模型能力变化而修订。