大语言模型
大语言模型是时下最新潮的概念,指拥有大量参数的、能够根据给定的文本序列生成新文本的模型。
本文介绍一些和大语言模型相关的概念与工具
单独一个语言模型的所有功能,就是在给定的文本序列上继续生成文本。这可以表示为一个函数
其中 是已经存在的文本序列, 是生成的下一个文本。
新文本生成后,会加入到已存在的文本序列中,继续用于生成新文本。模型不断重复这一过程,直到生成了一个特殊的、表示序列结束的文本。
当然上述定义过于简略且不准确
- 文本 是一种不标准的说法,正确的术语是 token,官方翻译为 词元
- 并不是一个完全确定的函数,给定相同的 token 序列,可能会产生不同的下一个 token
大语言模型(Large Language Model)之所以 大,就是因为其内部有大量参数。这些参数的具体值会在训练阶段被确定。人们发现当参数足够多后,语言模型会涌现出某种智能,而这就是划分语言模型和大语言模型的界限。
后续的所有应用,比如智能体,都只是基于大语言模型的这个功能构建的。
LLM 运行器能够运行大语言模型,且会提供可调用的 API
LLM 运行器通常用于本地调试基于 LLM 的应用,或者离线部署 LLM
- Ollama 支持本地运行模型,提供了客户端和服务端
智能体根据应用场景可分为很多种类型,但对开发者而言,最常用的还得是编程智能体。
由于我偏爱 CLI 版本的 Code Agent,因此只重点介绍这种工具。
- Codex 由 OpenAI 开发,其 CLI 版本已经开源,且用 Rust 编写
- OpenCode 其 CLI 版本用 TypeScript 编写
- Claude Code 由 Anthropic 开发,暂未开源。根据曾泄露的源码推断,其 CLI 版本用 TypeScript 编写
- Pi 开源的极简 Agent,可以通过插件增加功能
- DeepSeek Harness 比 Pi 更激进,一切皆插件,但官方只提供 Web UI
此外还有各种智能体管理器
- CC Switch 一个 All-in-One 的 AI Agent 管理器,支持 Codex/Claude Code/OpenCode 等主流工具,可以管理
skills/prompts/sessions/mcp各种资源,还可以一键切换 Agent 的配置