过去两年,AI 领域的新词爆发式涌现。今天我们经常听到 GPT、Token、Agent、Cursor、Ollama 等词汇,它们究竟是什么?彼此之间有何关联?
本文将抛开晦涩的数学公式,沿着"大脑诞生 → 驱动交互 → 终端落地 → 自主行动"的演进脉络,用最系统、扼要的方式为你理清这些核心概念。
架构总览:AI 生态的四层架构
理解 AI 概念最简单的方式,是将其分为四个层级:
┌──────────────────────────────────────────────────────────────────────────┐
│ 4. 行动层 (Agent & 工具):Cursor, OpenClaw, 智能体... │
├──────────────────────────────────────────────────────────────────────────┤
│ 3. 交互与部署层 (客户端/运行环境):ChatGPT, Ollama, OpenWebUI, CherryStudio │
├──────────────────────────────────────────────────────────────────────────┤
│ 2. 模型与算力层 (大脑):OpenAI(GPT/Codex), Claude... │
├──────────────────────────────────────────────────────────────────────────┤
│ 1. 基础概念层 (本质):模型, 大模型/LLM, Token, Prompt, 上下文 │
└──────────────────────────────────────────────────────────────────────────┘
第一层:基础概念 —— AI 的"底层积木"
在了解具体产品前,必须先掌握这套通用语言。这些概念是理解一切 AI 产品的元知识。
模型 (Model)
AI 的本质是一个通过海量数据训练出来的复杂数学函数。给它一个输入,它基于概率给出一个最可能的输出。
从"小模型"到"大模型"的跨越,关键在于参数规模的指数级膨胀。当参数量达到百亿、千亿级别时,模型突然展现出小模型不具备的涌现能力(Emergent Abilities)——比如逻辑推理、多步骤规划、甚至某种程度的"理解"。
大模型 / LLM (Large Language Model)
大语言模型是专门针对人类语言进行训练的巨型神经网络。它的核心训练目标极其简单:预测下一个 Token。但正是这个看似简单的任务,让 LLM 掌握了语法、语义、世界知识乃至推理能力。
2022 年底 ChatGPT 的横空出世,本质上是让公众第一次直观感受到了 LLM 的能力边界。
Token:AI 世界的"原子"
模型并不直接认识"字"或"单词"。它处理的是Token——文本被切分后的最小计量单位。
| 语言 | 示例 | Token 化结果 |
|---|---|---|
| 英文 | "Hello world" | ["Hello", " world"] |
| 中文 | "人工智能" | ["人工", "智能"] 或更细的切分 |
关键认知:
- 100 个汉字 ≈ 100~150 个 Token
- API 计费按 Token 数量计算
- 模型的"记忆力"(上下文窗口)以 Token 数为上限
- 模型处理速度也以 Token/秒 衡量
Prompt (提示词)
用户输入给模型的指令或问题。Prompt 是人机交互的起点,也是当前控制大模型最主要的方式。
Prompt 工程(Prompt Engineering)已成为一门显学:同样的模型,优秀的 Prompt 能让输出质量天差地别。从简单问答到复杂的"角色扮演+思维链+输出格式约束",Prompt 的设计空间极大。
上下文 (Context / Context Window)
模型在一次对话中能够"记住"的前后文总长度。这是 LLM 最关键的硬约束之一。
- GPT-4 早期:8K / 32K Token
- Claude 3.5:200K Token(可一次性吞下整本小说或大型代码库)
- Gemini 1.5 Pro:百万级 Token(实验性)
超过上下文窗口怎么办? 模型会"遗忘"更早的内容。因此处理超长文档时,需要借助 RAG(检索增强生成)等技术手段。
第二层:模型与演进 —— "大脑"的演化史
大模型的突破源于几家顶尖机构的角逐,理解它们的谱系有助于把握技术走向。
OpenAI 与 GPT 家族
| 时间 | 里程碑 | 意义 |
|---|---|---|
| 2018 | GPT-1 | 证明"预训练+微调"范式的可行性 |
| 2019 | GPT-2 | 模型大到不便公开,引发伦理讨论 |
| 2020 | GPT-3 | 1750 亿参数,展现惊人零样本能力 |
| 2022 | ChatGPT | 基于 GPT-3.5 微调,对话能力质变 |
| 2023 | GPT-4 | 多模态、更强推理、更可靠 |
| 2024 | GPT-4o / o1 | 原生多模态 / 推理专用模型 |
OpenAI 作为本轮浪潮的引领者,其商业模式已从"研究非营利"转向"API+订阅"双轮驱动。
Codex:代码世界的特化大脑
OpenAI 早期针对编程场景训练的专用模型。它的核心洞见是:代码是更严谨的语言,训练代码能显著提升模型的逻辑推理能力。
Codex 后来演化为 GitHub Copilot 的底层引擎,也直接影响了 GPT-4 代码能力的飞跃。如今"代码能力"已成为衡量通用大模型水平的核心指标之一。
Claude:OpenAI 的"叛逆之子"
Anthropic 由前 OpenAI 核心成员于 2021 年创立,其旗舰模型 Claude 系列是 GPT 最强有力的竞争对手。
| 特性 | Claude 优势 |
|---|---|
| 长上下文 | 200K Token 稳定可用,远超同期竞品 |
| 代码能力 | Claude 3.5 Sonnet 被开发者公认为当前最佳编程助手 |
| 安全性 | "Constitutional AI"训练,更少有害输出 |
| 写作风格 | 更自然、更少"AI 味" |
Claude 的崛起证明:大模型赛道并非赢家通吃,差异化能力(如长文本、代码)可以建立坚实的用户壁垒。
第三层:交互与部署 —— "大脑"如何连接用户?
模型本身只是 API 接口,需要界面和通道才能真正服务人类。
官方集成产品
ChatGPT:OpenAI 基于 GPT 模型打造的现象级消费级应用。它将底层模型的技术能力转化为大众可感知的对话体验,两个月突破 1 亿用户,成为史上增长最快的产品。
ChatGPT 的成功在于精准的产品化:不是卖模型,而是卖"随时待命的万能助手"。
本地运行与开源生态:Ollama
Ollama 是本地大模型运行的事实标准工具。它的核心价值在于:
- 隐私安全:数据不出本地,适合敏感场景
- 零成本试用:无需 API 费用,开源模型免费使用
- 低门槛:一条命令
ollama run llama3即可运行 - 生态丰富:支持 Llama、Mistral、DeepSeek、Qwen 等主流开源模型
Ollama 的流行标志着 AI 从"云端垄断"走向"端侧普及",让个人开发者和小团队也能拥有专属 AI 能力。
第三方客户端:OpenWebUI 与 CherryStudio
仅有模型或 API 时,用户体验往往粗糙。第三方客户端填补了这一鸿沟。
OpenWebUI:
- 专为本地模型(尤其是 Ollama)设计的开源 Web 界面
- 功能对标 ChatGPT:多轮对话、Markdown 渲染、代码高亮
- 进阶能力:RAG 知识库、多用户管理、模型切换
- 定位:自托管的类 ChatGPT 体验,适合团队部署
CherryStudio (樱桃桌面):
- 近年来崛起的跨平台桌面客户端
- 核心能力:多源聚合——同时接入 OpenAI、Claude、DeepSeek、本地 Ollama 等多种 API
- 特色功能:Prompt 管理、对话分支、模型对比、快捷键呼出
- 定位:高阶用户的"AI 控制台",在不同模型间无缝切换
从 ChatGPT → Ollama → OpenWebUI/CherryStudio,体现了用户需求的分层分化:有人追求便捷,有人追求隐私;有人满足基础对话,有人需要专业工具。
第四层:进阶演化 —— 从"助手"到"智能体 (Agent)"
这是 AI 正在经历的最重要范式转移:从"信息生成"到"行动执行"。
助手 (Assistant) vs. 智能体 (Agent)
| 维度 | 助手 (Assistant) | 智能体 (Agent) |
|---|---|---|
| 核心能力 | 理解、生成、回答 | 感知、规划、执行、反馈 |
| 交互模式 | 被动响应 | 主动目标驱动 |
| 工具使用 | 无或简单调用 | 多工具组合、自主决策 |
| 典型场景 | 问答、写作、翻译 | 数据分析、自动运维、复杂任务执行 |
| 代表产品 | ChatGPT、Claude 网页版 | Cursor、AutoGPT、Devin |
关键区别:助手是"你说一句,我做一句";Agent 是"你给我目标,我自主搞定"。
Agent 的技术本质
实现 Agent 需要三大支柱:
- LLM 作为"大脑":负责理解意图、分解任务、决策判断
- 工具集 (Tools):搜索引擎、代码执行器、数据库、API 等
- 记忆与规划:短期记忆(上下文)+ 长期记忆(向量数据库)+ 任务规划能力
垂直落地的超级应用:Cursor
Cursor 是目前最成功的 AI-Native 代码编辑器,代表了 Agent 在垂直领域的深度落地。
| 能力层级 | 具体表现 |
|---|---|
| 基础层 | 代码补全、错误提示(类似 Copilot) |
| 进阶层 | 选中代码块,用自然语言要求修改 |
| Agent 层 | @ 引用整个代码库,AI 自主定位相关文件、分析依赖、跨文件修改 |
| 深度层 | Composer 模式:从需求描述到多文件代码生成,AI 自主规划实现步骤 |
Cursor 的成功秘诀:将 LLM 的上下文窗口优势(如 Claude 的 200K)与代码领域的工具链深度结合,让 AI 真正"理解"项目结构而非孤立补全。
自动化与执行代理:Claw / OpenClaw
Claw / OpenClaw 代表了另一类 Agent 形态:面向通用自动化任务的执行代理。
其核心能力是让大模型拥有控制浏览器、操作系统、API 接口的能力:
- 自主浏览网页、填写表单、抓取数据
- 执行终端命令、操作文件系统
- 调用第三方 API 完成预订、发送邮件等操作
与 Cursor 专注代码领域不同,Claw 类工具瞄准的是通用数字劳动力——让 AI 成为能替人类完成繁琐电脑操作的"数字打工人"。
OpenClaw 作为开源变体,降低了这类能力的获取门槛,让中小开发者也能构建自己的自动化 Agent。
延伸思考:我们正站在哪?
回顾整个发展脉络,可以清晰看到三条主线:
技术主线: 模型能力 ↑ → 上下文长度 ↑ → 多模态融合 ↑
产品主线: 单点工具 → 对话界面 → 垂直深度 → 通用 Agent
部署主线: 云端集中 → API 服务 → 本地私有化 → 端侧智能
当前阶段(2024-2025)的关键特征:
- 长上下文成为标配:百万 Token 不再是噱头,而是刚需
- Agent 从 demo 走向生产:Cursor 等产品的成功证明 Agent 模式可行
- 开源与闭源并驾齐驱:GPT-4/Claude 领先,但 Llama、DeepSeek 等快速追赶
- 端侧部署成为可能:Ollama 等工具让"个人 AI"触手可及
总结:一张心智模型卡片
如果你要向朋友一句话解释它们的关系:
OpenAI 和 Anthropic 制造了像 GPT、Claude 这样的 LLM(大模型);我们用 Prompt 驱动它,在 Context 范围内消耗 Token 计算答案;通过 ChatGPT 网页、CherryStudio 桌面端,或本地 Ollama + OpenWebUI 来与它们对话;当大模型掌握工具和执行能力,就进化成了 Agent,在代码领域诞生了 Cursor,在通用自动化领域演化出了 OpenClaw 等新型生产力工具。
最终,所有的技术演进都指向同一个未来:让 AI 从"能说话"走向"能做事",从"信息助手"进化为"数字伙伴"。