PLAYGROUND · 游乐场WECHAT-KIT · 公众号排版工作台
WECHAT-KIT
微信公众号主题化排版利器 · 纯内联样式与双黄金主题色 · 原生兼容富文本剪贴板
排版主题:
MARKDOWN 输入1261 字
微信公众号富文本即时预览INLINE STYLES
大语言模型基础:读懂智能体的大脑
现代智能体的核心是大语言模型(LLM)——它如何工作,决定了智能体能做什么、擅长什么。本文聚焦三个关键问题,带你看懂这颗「大脑」。
一、从 N-gram 到 Transformer
语言模型的根本任务是计算词序列出现的概率。2017 年提出的 Transformer 架构彻底抛弃循环结构,只靠自注意力机制捕捉全局依赖,支持并行训练与 temperature 等采样控制:
- • 自注意力:让序列中的每一个 Token 都与全局上下文直接交互;
- • 多头注意力:多个关注头分别捕捉语义、语法与指代关系;
- • 自回归接龙:核心逻辑即「预测下一个最可能的词元」。
生成式任务天然是逐词接龙,Decoder-Only 结构与该目标零损耗对齐,训练与推理效率也最高。
二、模型选型对比
| 架构阵营 | 代表模型 | 核心特点 |
|---|---|---|
| 闭源前沿 | GPT-4o, Claude, Gemini | 顶尖能力,开箱即用的稳定 API |
| 开源自主 | Llama 3, Qwen 2.5, DeepSeek | 可私有化部署定制,数据完全自主 |
三、智能体思考与行动回路
架构与流程用 flow 语法渲染为原生步骤卡片组,移动端零横滑:
四、最小可用智能体
# 注释:智能体主循环
class Agent:
def __init__(self, name, retries=3):
self.name = name # 行内注释
self.base_url = "https://api.example.com/v1/"
def run(self, task):
if task is None:
return None
return self.name + str(task)
延伸阅读可参考 Hello-Agents 教程[1];正文外链不可点,自动转为上标序号并汇总到文末「参考链接」卡。
所谓智能体,就是为大语言模型装上记忆、规划与工具调用的外挂手脚。