Transformer LLM Prompt RAG Agent

第6章 生成式AI

本章先建立概念体系(AI → 机器学习 → 深度学习 → 生成式 AI),再理解大语言模型如何工作;接着掌握 Prompt 工程、图像生成、RAG 与 Agent;最后认识局限、评估与负责任地使用 AI。

本章知识地图
一条主线:认识 GenAI → 理解 LLM → 学会 Prompt → 掌握多模态与系统构建 → 评估与安全
GenAI 基础
AI → ML → DL
LLM 原理
Token · Transformer
能力与应用
思考伙伴 · 多模态
Prompt 工程
结构化提问
RAG · Agent
检索增强 · 自主循环
评估 · 责任
可靠性与安全
01

生成式 AI 基础与 LLM 原理

生成式 AI(Generative AI)能根据提示词生成新内容。理解它之前,先看清它在人工智能谱系中的位置。

概念层级AI → ML → DL → 基础模型 → GenAI

人工智能 AI 让机器模拟人类智能的广泛领域(推理、感知、决策等)。
机器学习 ML 从数据中学习规律,而不是靠人工编写所有规则。
深度学习 DL 用深层神经网络自动提取特征,是当前最强大的机器学习方法之一。
基础模型 Foundation Model 在海量数据上预训练的通用大模型,可适配多种下游任务。
生成式 AI 能生成文本、图像、代码、音频等新内容的 AI,当前以大语言模型(LLM)为代表。
记忆口诀:AI 是大家庭 → ML 是其中会“从数据学习”的一支 → DL 是用深度网络的更强分支 → 生成式 AI 是能“创造新内容”的应用形态。

大语言模型(LLM)是什么?

核心能力 根据前面的文字,预测下一个最可能的词(Token)。通过海量文本训练,学会了语言规律、世界知识和推理模式。
Token 模型处理文本的最小单位(词、子词或字符)。输入和输出都按 Token 计费与计算,长度直接影响成本和上下文能力。
上下文窗口 模型一次能“看到”的最大 Token 数量。超出会截断或丢失早期信息。
预训练 + 对齐 先在互联网级文本上学习语言(预训练),再用人类反馈等技术让回答更有用、更安全(对齐 / RLHF 等)。

Transformer 与注意力机制现代 LLM 的核心架构

2017 年提出的 Transformer 让模型能并行处理序列,并通过“注意力”动态关注相关位置,是 GPT、Claude、Gemini、DeepSeek 等的基础。

自注意力 Self-Attention 计算序列中每个位置与其他位置的关联强度,让模型知道“该关注哪里”。
为什么重要 能捕捉长距离依赖,训练可高度并行,规模扩大后能力显著提升(Scaling Law)。
注意:模型并不“理解”世界,它是在统计规律上做预测。输出可能看似合理却事实错误,这就是后面要讲的“幻觉”。
一句话总结:生成式 AI 建立在深度学习之上;大语言模型通过预测下一个 Token 生成文本,Transformer 的注意力机制是其核心引擎。
本节小结
  • AI ⊃ 机器学习 ⊃ 深度学习 ⊃ 基础模型 / 生成式 AI。
  • LLM 的本质是“下一个 Token 预测器”,通过大规模预训练获得能力。
  • Token 是计费与上下文的基本单位;上下文窗口有限。
  • Transformer + 自注意力是现代 LLM 的标准架构。
?
课堂练习 · 1 基础与原理
1生成式 AI 与传统判别式 AI 的主要区别是(  )。
解析:参考答案:C
生成式模型学习数据分布并生成新样本;判别式模型侧重分类或判断。
2大语言模型生成文本的基本机制是(  )。
解析:参考答案:B
自回归生成:每次根据已有序列预测下一个最可能的 Token。
3Token 在 LLM 中的作用是(  )。
解析:参考答案:A
Token 是分词后的基本单元,输入输出均按 Token 计算。
4Transformer 架构的核心创新之一是(  )。
解析:参考答案:D
自注意力让模型动态关注序列中相关位置,且训练可高度并行。
02

LLM 的能力与典型应用

LLM 不只是“聊天机器人”,它可以成为思考伙伴、写作助手、编程搭档和多模态创造工具。

LLM 能做什么?

理解与总结 阅读长文、提取要点、对比观点、翻译与改写。
推理与分析 分步思考问题、分析利弊、提出假设与验证思路。
创作与表达 写文章、邮件、故事、诗歌,调整语气与受众。
编程与调试 写代码、解释代码、找 bug、优化性能、生成测试。
多模态 理解图像、生成图像、处理语音与视频(视具体模型)。

使用场景举例(大一学生可立即上手)

1学习助手:解释难懂概念、生成练习题、检查作业思路、模拟面试问答。
2写作伙伴:起草大纲、润色表达、转换正式/口语语气、检查逻辑漏洞。
3编程搭档:从自然语言生成代码、解释报错信息、补充注释与文档。
4研究入门:梳理某主题的关键文献脉络、对比不同观点、生成阅读清单。
重要提醒:AI 输出必须自己验证。它可能“一本正经地胡说八道”(幻觉),尤其是事实、数字、引用和最新信息。
一句话总结:把 LLM 当作“有广博知识但会犯错的助手”——善用其生成与推理能力,同时保持批判性核查。
本节小结
  • LLM 擅长理解、总结、推理、创作与编程辅助。
  • 大一阶段最实用的场景:学习解释、写作润色、代码辅助、资料梳理。
  • 永远验证关键事实与引用,不要直接把 AI 输出当作最终答案。
?
课堂练习 · 2 能力与应用
1下列哪项不是 LLM 的典型强项(  )。
解析:参考答案:B
实时高精度决策与交易需要专门系统与实时数据,LLM 本身不擅长。
2使用 LLM 辅助学习时,最合理的态度是(  )。
解析:参考答案:C
既发挥助手价值,又保持独立思考与事实核查。
03

从 Prompt 到 AI 系统

会提问是使用 AI 的第一步;会设计 Prompt、构建 RAG 与 Agent,才能真正把 AI 变成可靠的应用能力。

Prompt 的六要素结构化提示词的通用公式

1Role 角色:你是谁(资深教师 / 代码审查员 / 产品经理…)
2Task 任务:明确要求做什么
3Context 上下文:背景信息、已有材料、约束条件
4Constraints 约束:长度、风格、禁止事项、必须遵守的规则
5Output Format 输出格式:列表 / 表格 / JSON / 分点…
6Examples 示例:给 1~3 个好坏例子(少样本)
核心原则:Prompt Engineering 是迭代过程——写初版 → 看输出 → 评估 → 改进 → 再试。没有一次完美的提示词。

Prompt 技巧的三个层级

Level 1 基础 清晰指令、具体任务、提供上下文、设定约束。
Level 2 进阶 角色提示、少样本示例、结构化输出、分隔符。
Level 3 高阶 任务分解、自我检查、批评与修订、多步工作流。

图像生成与扩散模型

文生图流程:Text Prompt → 文本编码器 → 扩散模型(逐步去噪)→ 图像。图像 Prompt 可包含:主体、环境、构图、光照、风格、镜头、质量。

扩散模型 正向过程给图像加噪,反向过程学习去噪还原。现代系统多在潜在空间高效执行。
图像编辑 局部重绘(Inpainting)、扩展画布(Outpainting)、背景移除、图生图、风格迁移。

RAG:检索增强生成让模型“查资料再回答”

为什么需要 模型知识可能过时;私有数据看不到;领域知识缺失;容易幻觉。
核心流程 文档 → 切块 → 向量化 → 存入向量库 → 查询时相似度检索 → 把相关片段交给 LLM 生成答案。
价值 用外部证据支撑回答,显著降低幻觉,支持私有知识库。

Tools 与 Function Calling · AI Agent

工具调用 LLM 决定调用搜索、计算、代码执行、数据库等工具,拿到结果后再整合回答。
Agent 循环 Observe(观察)→ Think / Plan(思考规划)→ Act(行动,常调用工具)→ 再观察…直到完成。
演进路径 Chatbot(一问一答)→ Workflow(固定流程)→ RAG → Agent → Multi-Agent。
一句话总结:从写好 Prompt,到用 RAG 引入外部知识,再到 Agent 自主规划与调用工具——这条线把“会用 AI”升级为“会构建 AI 应用”。
本节小结
  • Prompt 六要素:Role + Task + Context + Constraints + Output Format + Examples。
  • 技巧三级:清晰指令 → 角色/少样本/结构化 → 分解/自检/多步工作流;本质是迭代。
  • 文生图依赖扩散模型;图像 Prompt 关注主体、环境、风格、质量等。
  • RAG = 检索相关文档 + LLM 生成,解决知识过时与幻觉。
  • Agent = 观察 → 思考 → 行动的循环,可自主使用工具完成复杂任务。
?
课堂练习 · 3 Prompt · RAG · Agent
1Prompt 的基本结构公式通常包含(  )。
解析:参考答案:C
结构化提示词的通用六要素。
2RAG 的主要目的是(  )。
解析:参考答案:B
通过检索相关文档补充上下文,让回答有据可依。
3AI Agent 的基本工作循环是(  )。
解析:参考答案:D
Agent 通过观察-思考-行动循环自主推进任务。
04

局限 · 评估 · 负责任 AI 与成本

会问 AI 之前,先学会判断 AI 的答案是否可靠——这是生成式 AI 时代最重要的素养。

生成式 AI 的主要局限

幻觉 Hallucination 非常自信地输出错误或虚假内容:事实错误、虚构人物/论文、虚假引用、错误计算与推理。
上下文窗口限制 输入输出长度有上限,超长内容需截断、压缩或使用长上下文模型。
结构化数据不擅长 精确表格计算、复杂数据库查询、大规模数值处理,更适合交给 SQL / Python 等工具。
偏见 Bias 训练数据中的文化、社会、代表性偏差可能被放大。
知识截止 训练后的新信息不在模型内;可用联网搜索、RAG、工具弥补。
任务类型更合适的工具
自然语言理解与生成LLM
精确数据库查询SQL
大规模数值计算 / 统计分析Python / R
电子表格处理Excel / Python
自然语言 + 数据库LLM + SQL(工具调用)

如何评估输出?

六维度 准确性、相关性、完整性、一致性、清晰性、证据支撑(Groundedness)。
评估方法 人工评估、自动化指标、LLM-as-a-Judge(用另一个 LLM 当裁判)、基准测试。
关键态度:AI Output ≠ 自动可信的信息。用于学习、作业或决策前,必须经过人类验证。

负责任 AI 的九大关注点

幻觉错误事实与虚假引用
偏见数据与文化的系统性偏差
隐私训练与使用中的个人信息泄露风险
版权生成内容可能涉及侵权
安全被用于恶意用途的风险
提示注入通过构造提示词劫持模型行为
数据泄露敏感数据被卷入上下文
错误信息生成内容被当作事实传播
人类监督关键决策必须有人参与把关

成本直觉

总成本 ≈ 模型选择 + 输入 Token + 输出 Token + 请求次数 + 工具 / 检索调用。

使用方式特点
免费对话入门体验,额度有限
付费对话更高额度与高级功能
API 调用按 Token 计费,可嵌入自己的应用
企业 / 私有部署数据不出内网,合规与规模需求
本地模型完全本地运行,隐私最好,算力要求高
一句话总结:生成式 AI 会幻觉、有偏见、受上下文与知识截止限制;学会用多维度评估输出、践行负责任使用原则、理解 Token 成本,才能安全、有效、经济地使用 AI。
本节小结
  • 五大局限:幻觉、上下文窗口、结构化数据不擅长、偏见、知识截止。
  • 评估六维度:准确性、相关性、完整性、一致性、清晰性、证据支撑。
  • 负责任 AI:关注幻觉、偏见、隐私、版权、安全、提示注入、数据泄露、错误信息与人类监督。
  • 成本由模型 + Token + 请求 + 工具构成;按需选择免费 / 付费 / API / 本地方案。
  • 核心原则:AI 输出必须人工验证后才能信任。
?
课堂练习 · 4 局限 · 评估 · 责任
1“幻觉”是指(  )。
解析:参考答案:A
幻觉即自信地输出事实错误、虚构内容、虚假引用等。
2精确数据库查询最合适的工具是(  )。
解析:参考答案:B
精确结构化查询用 SQL;LLM 可辅助生成 SQL 再执行。
3弥补“知识截止”的常用方法是(  )。
解析:参考答案:D
把最新外部知识引入上下文即可弥补知识截止。
4“提示注入”是指(  )。
解析:参考答案:A
攻击者把隐藏指令嵌入输入,诱导模型执行非预期行为。

延伸学习资源

课上演示与课后拓展——先动手体验,再深入原理与安全。

ChatGPT / Claude / Gemini

chatgpt.com · claude.ai · gemini.google.com

主流对话式 LLM,体验 Prompt 工程、总结、编程等各类任务。

DeepSeek / 通义千问

deepseek.com · tongyi.aliyun.com

中文友好的大模型,体验长上下文、推理与编程能力。

Hugging Face

huggingface.co

模型与数据集社区:下载开源模型、在线试用 Demo、学习 AI 生态。

LangChain / LlamaIndex

langchain.com · llamaindex.ai

构建 RAG、Agent、工具调用应用的主流框架与官方教程。

Coze / Dify / n8n

coze.cn · dify.ai · n8n.io

低代码 AI 工作流与 Agent 平台,可视化搭建多步自动化应用。

GitHub Copilot / Cursor

github.com/features/copilot · cursor.com

AI 编程工具,体验代码生成、补全与 AI IDE。

Microsoft 生成式 AI 入门课

github.com/microsoft/generative-ai-for-beginners

21 课免费课程,覆盖 Prompt、RAG、Agent 与负责任使用。

吴恩达 Prompt 课程

deeplearning.ai

《ChatGPT Prompt Engineering for Developers》等免费短课,实践导向。

随机提问
点击下方按钮开始
今日已提问:0/0