AlexSJC
AlexSJC
发布于 2026-09-06 / 1 阅读
0
0

从 LLM 到 Agent

#AI

过去两年,AI 领域的新词爆发式涌现。今天我们经常听到 GPT、Token、Agent、Cursor、Ollama 等词汇,它们究竟是什么?彼此之间有何关联?

本文将抛开晦涩的数学公式,沿着"大脑诞生 → 驱动交互 → 终端落地 → 自主行动"的演进脉络,用最系统、扼要的方式为你理清这些核心概念。

架构总览:AI 生态的四层架构

理解 AI 概念最简单的方式,是将其分为四个层级:

┌──────────────────────────────────────────────────────────────────────────┐
│ 4. 行动层 (Agent & 工具):Cursor, OpenClaw, 智能体...                      │
├──────────────────────────────────────────────────────────────────────────┤
│ 3. 交互与部署层 (客户端/运行环境):ChatGPT, Ollama, OpenWebUI, CherryStudio │
├──────────────────────────────────────────────────────────────────────────┤
│ 2. 模型与算力层 (大脑):OpenAI(GPT/Codex), Claude...                       │
├──────────────────────────────────────────────────────────────────────────┤
│ 1. 基础概念层 (本质):模型, 大模型/LLM, Token, Prompt, 上下文               │
└──────────────────────────────────────────────────────────────────────────┘

第一层:基础概念 —— AI 的"底层积木"

在了解具体产品前,必须先掌握这套通用语言。这些概念是理解一切 AI 产品的元知识

模型 (Model)

AI 的本质是一个通过海量数据训练出来的复杂数学函数。给它一个输入,它基于概率给出一个最可能的输出。

从"小模型"到"大模型"的跨越,关键在于参数规模的指数级膨胀。当参数量达到百亿、千亿级别时,模型突然展现出小模型不具备的涌现能力(Emergent Abilities)——比如逻辑推理、多步骤规划、甚至某种程度的"理解"。

大模型 / LLM (Large Language Model)

大语言模型是专门针对人类语言进行训练的巨型神经网络。它的核心训练目标极其简单:预测下一个 Token。但正是这个看似简单的任务,让 LLM 掌握了语法、语义、世界知识乃至推理能力。

2022 年底 ChatGPT 的横空出世,本质上是让公众第一次直观感受到了 LLM 的能力边界。

Token:AI 世界的"原子"

模型并不直接认识"字"或"单词"。它处理的是Token——文本被切分后的最小计量单位。

语言 示例 Token 化结果
英文 "Hello world" ["Hello", " world"]
中文 "人工智能" ["人工", "智能"] 或更细的切分

关键认知

  • 100 个汉字 ≈ 100~150 个 Token
  • API 计费按 Token 数量计算
  • 模型的"记忆力"(上下文窗口)以 Token 数为上限
  • 模型处理速度也以 Token/秒 衡量

Prompt (提示词)

用户输入给模型的指令或问题。Prompt 是人机交互的起点,也是当前控制大模型最主要的方式

Prompt 工程(Prompt Engineering)已成为一门显学:同样的模型,优秀的 Prompt 能让输出质量天差地别。从简单问答到复杂的"角色扮演+思维链+输出格式约束",Prompt 的设计空间极大。

上下文 (Context / Context Window)

模型在一次对话中能够"记住"的前后文总长度。这是 LLM 最关键的硬约束之一。

  • GPT-4 早期:8K / 32K Token
  • Claude 3.5:200K Token(可一次性吞下整本小说或大型代码库)
  • Gemini 1.5 Pro:百万级 Token(实验性)

超过上下文窗口怎么办? 模型会"遗忘"更早的内容。因此处理超长文档时,需要借助 RAG(检索增强生成)等技术手段。

第二层:模型与演进 —— "大脑"的演化史

大模型的突破源于几家顶尖机构的角逐,理解它们的谱系有助于把握技术走向。

OpenAI 与 GPT 家族

时间 里程碑 意义
2018 GPT-1 证明"预训练+微调"范式的可行性
2019 GPT-2 模型大到不便公开,引发伦理讨论
2020 GPT-3 1750 亿参数,展现惊人零样本能力
2022 ChatGPT 基于 GPT-3.5 微调,对话能力质变
2023 GPT-4 多模态、更强推理、更可靠
2024 GPT-4o / o1 原生多模态 / 推理专用模型

OpenAI 作为本轮浪潮的引领者,其商业模式已从"研究非营利"转向"API+订阅"双轮驱动。

Codex:代码世界的特化大脑

OpenAI 早期针对编程场景训练的专用模型。它的核心洞见是:代码是更严谨的语言,训练代码能显著提升模型的逻辑推理能力

Codex 后来演化为 GitHub Copilot 的底层引擎,也直接影响了 GPT-4 代码能力的飞跃。如今"代码能力"已成为衡量通用大模型水平的核心指标之一。

Claude:OpenAI 的"叛逆之子"

Anthropic 由前 OpenAI 核心成员于 2021 年创立,其旗舰模型 Claude 系列是 GPT 最强有力的竞争对手。

特性 Claude 优势
长上下文 200K Token 稳定可用,远超同期竞品
代码能力 Claude 3.5 Sonnet 被开发者公认为当前最佳编程助手
安全性 "Constitutional AI"训练,更少有害输出
写作风格 更自然、更少"AI 味"

Claude 的崛起证明:大模型赛道并非赢家通吃,差异化能力(如长文本、代码)可以建立坚实的用户壁垒

第三层:交互与部署 —— "大脑"如何连接用户?

模型本身只是 API 接口,需要界面和通道才能真正服务人类。

官方集成产品

ChatGPT:OpenAI 基于 GPT 模型打造的现象级消费级应用。它将底层模型的技术能力转化为大众可感知的对话体验,两个月突破 1 亿用户,成为史上增长最快的产品。

ChatGPT 的成功在于精准的产品化:不是卖模型,而是卖"随时待命的万能助手"。

本地运行与开源生态:Ollama

Ollama 是本地大模型运行的事实标准工具。它的核心价值在于:

  • 隐私安全:数据不出本地,适合敏感场景
  • 零成本试用:无需 API 费用,开源模型免费使用
  • 低门槛:一条命令 ollama run llama3 即可运行
  • 生态丰富:支持 Llama、Mistral、DeepSeek、Qwen 等主流开源模型

Ollama 的流行标志着 AI 从"云端垄断"走向"端侧普及",让个人开发者和小团队也能拥有专属 AI 能力。

第三方客户端:OpenWebUI 与 CherryStudio

仅有模型或 API 时,用户体验往往粗糙。第三方客户端填补了这一鸿沟。

OpenWebUI

  • 专为本地模型(尤其是 Ollama)设计的开源 Web 界面
  • 功能对标 ChatGPT:多轮对话、Markdown 渲染、代码高亮
  • 进阶能力:RAG 知识库、多用户管理、模型切换
  • 定位:自托管的类 ChatGPT 体验,适合团队部署

CherryStudio (樱桃桌面)

  • 近年来崛起的跨平台桌面客户端
  • 核心能力:多源聚合——同时接入 OpenAI、Claude、DeepSeek、本地 Ollama 等多种 API
  • 特色功能:Prompt 管理、对话分支、模型对比、快捷键呼出
  • 定位:高阶用户的"AI 控制台",在不同模型间无缝切换

从 ChatGPT → Ollama → OpenWebUI/CherryStudio,体现了用户需求的分层分化:有人追求便捷,有人追求隐私;有人满足基础对话,有人需要专业工具。

第四层:进阶演化 —— 从"助手"到"智能体 (Agent)"

这是 AI 正在经历的最重要范式转移:从"信息生成"到"行动执行"。

助手 (Assistant) vs. 智能体 (Agent)

维度 助手 (Assistant) 智能体 (Agent)
核心能力 理解、生成、回答 感知、规划、执行、反馈
交互模式 被动响应 主动目标驱动
工具使用 无或简单调用 多工具组合、自主决策
典型场景 问答、写作、翻译 数据分析、自动运维、复杂任务执行
代表产品 ChatGPT、Claude 网页版 Cursor、AutoGPT、Devin

关键区别:助手是"你说一句,我做一句";Agent 是"你给我目标,我自主搞定"。

Agent 的技术本质

实现 Agent 需要三大支柱:

  1. LLM 作为"大脑":负责理解意图、分解任务、决策判断
  2. 工具集 (Tools):搜索引擎、代码执行器、数据库、API 等
  3. 记忆与规划:短期记忆(上下文)+ 长期记忆(向量数据库)+ 任务规划能力

垂直落地的超级应用:Cursor

Cursor 是目前最成功的 AI-Native 代码编辑器,代表了 Agent 在垂直领域的深度落地。

能力层级 具体表现
基础层 代码补全、错误提示(类似 Copilot)
进阶层 选中代码块,用自然语言要求修改
Agent 层 @ 引用整个代码库,AI 自主定位相关文件、分析依赖、跨文件修改
深度层 Composer 模式:从需求描述到多文件代码生成,AI 自主规划实现步骤

Cursor 的成功秘诀:将 LLM 的上下文窗口优势(如 Claude 的 200K)与代码领域的工具链深度结合,让 AI 真正"理解"项目结构而非孤立补全。

自动化与执行代理:Claw / OpenClaw

Claw / OpenClaw 代表了另一类 Agent 形态:面向通用自动化任务的执行代理

其核心能力是让大模型拥有控制浏览器、操作系统、API 接口的能力:

  • 自主浏览网页、填写表单、抓取数据
  • 执行终端命令、操作文件系统
  • 调用第三方 API 完成预订、发送邮件等操作

与 Cursor 专注代码领域不同,Claw 类工具瞄准的是通用数字劳动力——让 AI 成为能替人类完成繁琐电脑操作的"数字打工人"。

OpenClaw 作为开源变体,降低了这类能力的获取门槛,让中小开发者也能构建自己的自动化 Agent。

延伸思考:我们正站在哪?

回顾整个发展脉络,可以清晰看到三条主线:

技术主线:  模型能力 ↑  →  上下文长度 ↑  →  多模态融合 ↑
产品主线:  单点工具  →  对话界面  →  垂直深度  →  通用 Agent
部署主线:  云端集中  →  API 服务  →  本地私有化  →  端侧智能

当前阶段(2024-2025)的关键特征

  • 长上下文成为标配:百万 Token 不再是噱头,而是刚需
  • Agent 从 demo 走向生产:Cursor 等产品的成功证明 Agent 模式可行
  • 开源与闭源并驾齐驱:GPT-4/Claude 领先,但 Llama、DeepSeek 等快速追赶
  • 端侧部署成为可能:Ollama 等工具让"个人 AI"触手可及

总结:一张心智模型卡片

如果你要向朋友一句话解释它们的关系:

OpenAIAnthropic 制造了像 GPTClaude 这样的 LLM(大模型);我们用 Prompt 驱动它,在 Context 范围内消耗 Token 计算答案;通过 ChatGPT 网页、CherryStudio 桌面端,或本地 Ollama + OpenWebUI 来与它们对话;当大模型掌握工具和执行能力,就进化成了 Agent,在代码领域诞生了 Cursor,在通用自动化领域演化出了 OpenClaw 等新型生产力工具。

最终,所有的技术演进都指向同一个未来:让 AI 从"能说话"走向"能做事",从"信息助手"进化为"数字伙伴"。


评论