Mylofi
PLAYGROUND · 游乐场WECHAT-KIT · 公众号排版工作台

WECHAT-KIT

微信公众号主题化排版利器 · 纯内联样式与双黄金主题色 · 原生兼容富文本剪贴板

排版主题:
MARKDOWN 输入1261 字
微信公众号富文本即时预览INLINE STYLES

大语言模型基础:读懂智能体的大脑

现代智能体的核心是大语言模型(LLM)——它如何工作,决定了智能体能做什么、擅长什么。本文聚焦三个关键问题,带你看懂这颗「大脑」。

一、从 N-gram 到 Transformer

语言模型的根本任务是计算词序列出现的概率。2017 年提出的 Transformer 架构彻底抛弃循环结构,只靠自注意力机制捕捉全局依赖,支持并行训练与 temperature 等采样控制:

  • • 自注意力:让序列中的每一个 Token 都与全局上下文直接交互;
  • • 多头注意力:多个关注头分别捕捉语义、语法与指代关系;
  • • 自回归接龙:核心逻辑即「预测下一个最可能的词元」。
💡 主流架构为何是 Decoder-Only?

生成式任务天然是逐词接龙,Decoder-Only 结构与该目标零损耗对齐,训练与推理效率也最高。

二、模型选型对比

架构阵营代表模型核心特点
闭源前沿GPT-4o, Claude, Gemini顶尖能力,开箱即用的稳定 API
开源自主Llama 3, Qwen 2.5, DeepSeek可私有化部署定制,数据完全自主

三、智能体思考与行动回路

架构与流程用 flow 语法渲染为原生步骤卡片组,移动端零横滑:

●执行流程
感知识别Input
接收外部环境多模态输入与用户指令
↓ 格式化为标准 Prompt
规划中枢Planner
基于 LLM 进行任务拆解与思维链推理
↓ 调用外部 API / 知识库
工具执行Executor
运行代码解释器或检索向量知识库
↓ 整合结果生成响应
反馈闭环Output
将执行结果写入短期记忆并输出给用户

四、最小可用智能体

# 注释:智能体主循环
class Agent:
    def __init__(self, name, retries=3):
        self.name = name          # 行内注释
        self.base_url = "https://api.example.com/v1/"

    def run(self, task):
        if task is None:
            return None
        return self.name + str(task)

延伸阅读可参考 Hello-Agents 教程[1];正文外链不可点,自动转为上标序号并汇总到文末「参考链接」卡。


所谓智能体,就是为大语言模型装上记忆、规划与工具调用的外挂手脚。

🔗 参考链接
[1] Hello-Agents 教程:https://example.com/hello-agents