跳转到内容

大语言模型

大语言模型是时下最新潮的概念,指拥有大量参数的、能够根据给定的文本序列生成新文本的模型。

本文介绍一些和大语言模型相关的概念与工具

单独一个语言模型的所有功能,就是在给定的文本序列上继续生成文本。这可以表示为一个函数

yt=L(y0,y1,,yt1)y_t = L(y_0, y_1, \cdots, y_{t-1})

其中 y0,y1,,yt1y_0, y_1, \cdots, y_{t-1} 是已经存在的文本序列,yty_t 是生成的下一个文本。

新文本生成后,会加入到已存在的文本序列中,继续用于生成新文本。模型不断重复这一过程,直到生成了一个特殊的、表示序列结束的文本。

当然上述定义过于简略且不准确

  • 文本 是一种不标准的说法,正确的术语是 token,官方翻译为 词元
  • LL 并不是一个完全确定的函数,给定相同的 token 序列,可能会产生不同的下一个 token

大语言模型(Large Language Model)之所以 ,就是因为其内部有大量参数。这些参数的具体值会在训练阶段被确定。人们发现当参数足够多后,语言模型会涌现出某种智能,而这就是划分语言模型和大语言模型的界限。

后续的所有应用,比如智能体,都只是基于大语言模型的这个功能构建的。

LLM 运行器能够运行大语言模型,且会提供可调用的 API

LLM 运行器通常用于本地调试基于 LLM 的应用,或者离线部署 LLM

  • Ollama 支持本地运行模型,提供了客户端和服务端

智能体根据应用场景可分为很多种类型,但对开发者而言,最常用的还得是编程智能体。

由于我偏爱 CLI 版本的 Code Agent,因此只重点介绍这种工具。

  • Codex 由 OpenAI 开发,其 CLI 版本已经开源,且用 Rust 编写
  • OpenCode 其 CLI 版本用 TypeScript 编写
  • Claude Code 由 Anthropic 开发,暂未开源。根据曾泄露的源码推断,其 CLI 版本用 TypeScript 编写
  • Pi 开源的极简 Agent,可以通过插件增加功能
  • DeepSeek Harness 比 Pi 更激进,一切皆插件,但官方只提供 Web UI

此外还有各种智能体管理器

  • CC Switch 一个 All-in-One 的 AI Agent 管理器,支持 Codex/Claude Code/OpenCode 等主流工具,可以管理 skills/prompts/sessions/mcp 各种资源,还可以一键切换 Agent 的配置