七个章节,从概念到实战,每节课都有生动的类比和真实案例,帮你建立正确直觉,而不只是「听说过」。
用你最熟悉的比喻,理解大语言模型的本质。它不是「真正的智能」,但它极其强大。
Token、训练、预测下一个词……不需要数学,用故事讲清楚 LLM 的运转方式。
学会「和 AI 说话」是一项超有用的技能。好的提示词让 AI 发挥 10 倍威力。
ChatGPT、Claude、Gemini、Midjourney……认识这些工具,知道该用哪个。
AI 不只能聊天,还能自主行动!Agents 是让 AI 变成「你的数字员工」的关键。
不会写代码?没关系。用 Claude Code、Cursor 等工具,让 AI 帮你把想法变成真正的软件。
AI 改变世界的速度很快,但不要慌。聊聊如何保持学习、找到自己的位置。
从「人工智能」这四个字说起,先分清 AI、机器学习和大语言模型之间的关系。
「人工智能」(Artificial Intelligence,简称 AI)这个词已经存在了几十年。从最早的国际象棋程序,到今天的 ChatGPT、Claude 和各种智能工具,AI 一直在演化。
广义上说,AI 是让计算机完成通常需要人类智能才能完成的任务的一类技术,比如识别、预测、生成、规划和辅助决策。你手机里的「人脸解锁」、导航里的「预计到达时间」、购物 App 里的「猜你喜欢」——这些都可以算 AI。
AI 像一个能力很强、但需要边界的助手。它可以从大量数据里学出规律,帮你识别图片、整理文字、生成方案;但它不是人脑,也不会自动承担事实正确、价值判断和最终责任。
深度学习:你给模型看 10 万张已经标好“猫”或“狗”的照片。它不是背答案,而是慢慢学会猫耳朵、狗鼻子、脸型、轮廓这些规律。以后给它一张新照片,它就能判断更像猫还是更像狗。
强化学习:你让机器人学走路。它一开始乱走,走稳了就加分,摔倒了就扣分。它反复尝试后,会学到哪些动作更容易拿高分。训练大模型时,也可以让模型生成多个答案,人类或评分器告诉它哪个更好,它再学着下次答得更好。
一句话:深度学习像“看很多例子后学会识别规律”,强化学习像“做完以后根据分数改进下一次做法”。
LLM(大语言模型)是 AI 里专门处理语言的一类模型。「大」指的是模型规模和训练数据规模都很大:很多现代 LLM 有数十亿到数千亿个「参数」(你可以理解为神经网络里的小旋钮),并从大量文本、代码和其他资料中学习语言规律。
LLM 看起来能理解你说的话,是因为它能根据上下文抓住意图、关系和格式,并生成流畅的回应。但这不等于它真正知道事实,也不等于它一定正确。它之所以进入日常工作,是因为模型规模、数据质量、训练方法、对齐方式和工具生态一起进步,让翻译、写作、编程、分析和创作都变得更容易。
想象一个语言助手读过大量书籍、网页、代码、说明书和对话材料。它不是把世界上所有文字都背下来,也不是像人一样体验世界;它是在给定上下文后,根据学到的语言和知识模式,一步步生成最可能有用的回应。这就是 LLM。
| 名称 | 来自哪里 | 特点 |
|---|---|---|
| GPT 系列 | OpenAI(美国) | 常见于 ChatGPT,综合能力强,适合写作、分析、代码和多模态任务 |
| Claude 系列 | Anthropic(美国) | 长文本、写作和代码体验好,强调安全边界和回答质量 |
| Gemini 系列 | Google(美国) | 与 Google 生态结合紧密,适合多模态和资料处理场景 |
| DeepSeek 系列 | 深度求索(中国) | 中文、代码和推理任务中常被使用,适合做技术和学习辅助 |
| Qwen(通义)系列 | 阿里巴巴(中国) | 中文能力和企业云生态接入较方便,适合国内业务场景 |
这些模型各有优缺点,没有绝对「最好」的。就像选择工具一样,用对场景才是关键。后面的章节我们会详细介绍。
下面只讲一件事:参数不是“某一条线”,而是模型内部大量可调整的数字。它们参与计算,让模型判断下一个 token 最可能是什么。Transformer 和注意力机制的细节放到下一段再讲。
训练就是不断调整这些参数,让模型对下一个 token 的预测更接近训练目标。这里不展开 Transformer 的内部细节,下一段会专门讲它为什么能理解上下文关系。
不需要数学公式,用故事讲清楚 Token、训练和涌现。
LLM 不像我们一样一个字一个字地读,而是将文字切成一段段的「Token」。你可以把 Token 理解为「词块」:
理解 Token 很重要,因为 LLM 有「上下文窗口」限制——就像人的短期记忆有限,一次对话能处理的 Token 有上限(GPT-4 约 128K,Claude 约 200K)。
LLM 最核心的工作原理出奇地简单:给定前面的文字,预测下一个 Token 最可能是什么。
就像语文课上的完形填空,「今天天气_____,我决定出去散步」——你会自然地填「很好」或「不错」。LLM 也在做类似的事,只是规模大了几亿倍,而且它做了无数次这样的训练。
训练硬件是用来把模型训练出来,或对模型做大幅微调。它更看重多卡集群、高速互联、大显存、数据吞吐和长时间稳定运行。训练会反复读取大量数据、反复更新模型参数,所以成本高、周期长。
推理硬件是用来把已经训练好的模型跑起来,给员工或客户回答问题。它更看重显存能不能装下模型、并发能不能扛住、响应延迟够不够低、上下文长度够不够用,以及服务是否稳定。企业本地部署大模型,多数时候主要是在规划推理服务器。
一句话:训练服务器负责“造模型 / 调模型”,推理服务器负责“让模型上线接请求”。
研究者发现了一个有趣的现象:当模型规模小时,它的能力很一般;但当规模超过某个临界点,它突然涌现出很多没有明确训练过的能力——比如做数学推理、写诗、解释笑话……
水在 0 摄氏度以上是液态,降到 0 摄氏度就突然凝固——这就是「相变」。LLM 的涌现类似:参数量不断增加,看似没变化,但某一刻突然「跃迁」出了新能力。
这也是为什么 2022 年 ChatGPT 发布后,全世界都被震惊了——大家突然意识到 AI 到达了一个新的临界点。
LLM 不是从左到右死板地读句子——它同时看所有词,并判断「这个词应该关注哪些其他词」。点击下方任意一个词,看看它的注意力分布。
当你点击「它」,你会发现它对「书」的注意力权重最高——这就是模型知道「它」指的是「书」而不是其他词的原因。注意力机制让 AI 能理解长距离的语言关联。
和 AI 说话是门学问。学会写好提示词,AI 的能力能提升 10 倍。
Prompt(提示词)就是你对 AI 说的话。但更准确地说,写 Prompt 是在把需求分发给 AI。
很多人在工作里习惯接需求:别人告诉你要做什么、为什么做、做到什么标准。面对 AI 时,角色反过来了,你要负责分发需求,把目标、背景、边界和验收标准交代清楚。
和 AI 交流像把一项任务派给一个能力很强、但不了解你业务现场的同事。需求分发得越清楚,它完成得越接近你的预期;需求只说一半,它就只能按通用理解去做。
第一次回答不满意?直接说「再改改,这次要……」。AI 支持多轮对话,可以不断打磨,像雕塑一样慢慢完善。
Temperature(温度)控制 AI 回复的「创意程度」。拖动下方的滑块,看看同一个问题在不同温度下会得到什么样的回答。
写代码、提取数据时用低温度(稳定准确);写故事、头脑风暴时用高温度(充满创意)。大多数日常对话在 0.7–1.0 之间效果最好。
认识这些工具,知道什么场景用哪个,少走弯路。
| 用途 | 推荐工具 | 适合场景 |
|---|---|---|
| 对话 / 写作 / 分析 | ChatGPT、Claude、Kimi、豆包 | 写文章、总结资料、头脑风暴、学习辅导 |
| AI 画图 | Midjourney、Stable Diffusion、即梦 | 创意图、海报设计、插画生成 |
| AI 音乐 | Suno、Udio | 生成任何风格的歌曲,可有歌词 |
| AI 视频 | Runway、可灵、Sora | 文字/图片转视频,短片制作 |
| AI 编程 | Cursor、Claude Code、GitHub Copilot | 代码补全、用自然语言写软件 |
| AI 搜索 | Perplexity、Kimi 搜索 | 像 Google 但会总结、有引用来源 |
| AI 办公 | WPS AI、Notion AI、微软 Copilot | PPT、表格、邮件自动化 |
先把 ChatGPT 或 Claude 用熟,因为它们是「万能型」工具。其他垂直工具等有具体需求再学,不用全部学遍。
Claude(由 Anthropic 公司开发)是本教程重点推荐的模型之一。它有几个独特之处:
当你在 ChatGPT 里打字,网页背后通常会把你的需求整理成一段 JSON,再发给模型接口。不同厂商字段名会不同,但核心都是:模型、规则、用户输入、参数和返回内容。
{
"model": "enterprise-assistant",
"messages": [
{
"role": "system",
"content": "你是企业知识库助手,回答要准确、简洁。"
},
{
"role": "user",
"content": "把这段会议纪要整理成 3 条行动项。"
}
],
"temperature": 0.2,
"stream": false
}
{
"choices": [
{
"message": {
"role": "assistant",
"content": "1. 张三周五前提交预算表..."
}
}
],
"usage": {
"prompt_tokens": 42,
"completion_tokens": 28
}
}
API 可以理解成后台和模型之间约定好的 JSON 通道。业务系统不用打开聊天网页,也可以把订单、合同、知识库或表单数据整理成 JSON,直接交给模型处理。
LLM 只是「大脑」,Agents 让 AI 有了「手」——能自主行动、使用工具、完成复杂任务。
普通的 ChatGPT 对话:AI 只能输出文字,不能真正发邮件、搜最新新闻、操作你的电脑。
而 AI Agent 则不同——
LLM 是一个极其聪明的顾问,但它只能坐在椅子上给你建议。Agent 是同一个顾问,但现在它有了手机、电脑、信用卡——它可以直接去做事情,不只是说说而已。
Agent 不是一次性生成答案,而是反复循环「思考 → 行动 → 观察」。点击播放,看一个真实的 Agent 任务是怎么执行的。
这种「边想边做」的方式让 Agent 能应对复杂任务——每次行动后都会根据新信息重新思考,而不是盲目执行。
Agent 能操作电脑,不是因为模型自己能碰到你的系统,而是程序给它开放了工具。模型先判断要用哪个工具,程序再在本地执行对应命令,把结果返回给模型继续分析。
import { execFile } from 'node:child_process';
const tools = {
list_files: {
command: 'ls',
args: ['-la'],
description: '查看当前项目文件'
},
run_tests: {
command: 'npm',
args: ['test'],
description: '运行项目测试'
}
};
function runTool(toolName) {
const tool = tools[toolName];
if (!tool) throw new Error('未知工具');
return new Promise((resolve) => {
execFile(tool.command, tool.args, {
cwd: '/path/to/project',
timeout: 10000
}, (error, stdout, stderr) => {
resolve({
ok: !error,
stdout,
stderr,
error: error?.message || null
});
});
});
}
const agentDecision = {
thought: '我需要先看看项目里有哪些文件。',
tool: 'list_files'
};
const result = await runTool(agentDecision.tool);
console.log(result.stdout);
关键点:模型负责“决定要做什么”,程序负责“真正执行命令”。真实产品里还要加权限控制、命令白名单、日志记录和人工确认,避免 Agent 随便操作系统。
所以客户看到的 Agent,本质上是“模型 + 工具接口 + 执行环境”。当工具接口接到本地命令、文件系统、数据库或业务 API,Agent 才能从聊天变成真正做事。
LLM 是 Agent 的底座,但一个真正能落地工作的 Agent,关键不只是模型本身,而是它读什么规则、记住什么上下文、能调用什么工具,以及怎么连接外部系统。
| 框架 | 特点 | 适合谁用 |
|---|---|---|
| Claude Code | Anthropic 出品,专注代码开发,在终端直接操控代码库 | 想用 AI 写代码的所有人 |
| Cursor | AI 代码编辑器,有图形界面,像 VS Code 加了 AI | 程序员或想学编程的人 |
| LangChain | Python 框架,可以组合 LLM + 工具 + 记忆,构建复杂 Agent | 开发者,需要一定编程基础 |
| AutoGPT | 自动分解目标并执行,探索性项目 | 想玩自动化实验的人 |
| n8n / Zapier + AI | 可视化自动化工作流,无需写代码 | 不会编程,想自动化工作的人 |
Agent.md、Memory、Tools、Skills、MCP 不是五个孤立模块。它们会在 Agent 的「思考 → 行动 → 观察 → 再思考」循环里按顺序参与工作。
一句话:Agent.md 定规则,Memory 给上下文,Skills 给方法,Tools 执行动作,MCP 连接外部系统。它们都服务于同一个循环:思考、行动、观察,再继续思考。
不会写代码?没问题。现在的 AI 工具已经可以让你把想法直接变成软件。
Claude Code 是 Anthropic 开发的 AI 编程助手,可以直接在命令行里工作,理解整个代码库、写代码、修 Bug、运行测试。不懂命令行?没问题,一步步来:
# 全局安装 Claude Code npm install -g @anthropic-ai/claude-code # 进入你的项目文件夹 cd my-project # 启动 Claude Code claude
你不需要懂代码来使用 Claude Code。你需要的只是:清晰地描述你想要什么结果。Claude Code 会处理所有技术细节。
Git 是代码的「时光机」——每次 Commit 就是保存一个快照,出了问题可以随时回退。下面模拟一个真实的 Git 工作流,亲手操作试试。
和 AI 协作开发时,每完成一个小功能就 Commit 一次,是最安全的工作方式。AI 改坏了代码?一键回到上一个版本。
AI 不是你的替代品,而是你的超级放大器。
很多人以为 AI 时代是「工程师的时代」,但事实恰恰相反。AI 把编程的门槛降低了,把创意的价值放大了。在 AI 时代,最有价值的能力是:
Google 发表《Attention is All You Need》,奠定了所有现代 LLM 的基础架构。当时很少人意识到这篇论文的意义。
OpenAI 发布拥有 1750 亿参数的 GPT-3,AI 界震惊。它第一次展示了「规模带来涌现」的威力。
ChatGPT 上线仅 5 天用户突破 100 万,2 个月突破 1 亿。这是人类历史上增长最快的消费级应用。
Claude、Gemini、Llama、Mistral……各家大模型涌现。AI 编程工具爆发,Cursor 崛起。
AI 从「聊天助手」进化为「自主 Agent」。Claude Code、Devin 等工具让 AI 可以独立完成复杂软件开发任务。
这是学习 AI 最好的时机。工具已经足够成熟,学习曲线已经足够平缓,而先行者的红利还没消失。
不要追求「完全学会再用」。AI 工具每周都在更新,最好的学习方式是边用边学。一个月后,你会发现自己已经在用 AI 的视角看世界了。
「AI 对齐」描述的是 AI 的行为和人类价值观之间的吻合程度。拖动滑块,看看不同对齐程度的 AI 会怎么表现。
Anthropic 开发 Claude 的核心使命就是确保 AI 尽可能停留在「完全对齐」的一侧。这不只是技术问题,也是伦理问题——这也是为什么 AI 安全研究越来越重要。
每一章都有对应的练习,动手才能真正掌握。
学习 AI 最常见的疑问,都在这里。