AI Agent 开发入门:从概念到实践

本文是「AI Agent 开发系列」的第一篇,旨在帮有后端开发经验的读者快速建立 Agent 技术全景,理解核心概念和主流框架,为后续的实战开发打下基础。

什么是 AI Agent?

AI Agent(智能体)不是聊天机器人的升级版——它是一种范式转变。传统聊天机器人:你问,它答。AI Agent:你给一个目标,它自主规划、调用工具、执行任务、根据反馈调整,全程不需要你逐步引导。

举一个直观的例子:

场景 传统 ChatBot AI Agent
查天气 “今天北京天气怎么样?” → 回答 “帮我安排明天北京的户外活动” → 查天气 → 搜景点 → 规划路线 → 给出完整方案
写代码 “帮我写一个排序函数” → 返回代码 “帮我实现一个用户管理系统” → 分析需求 → 选技术栈 → 写代码 → 跑测试 → 修复 bug → 部署
数据分析 “这个表的数据汇总一下” → 返回统计 “分析这个季度的销售数据,找出增长点和问题” → 读数据 → 多维度分析 → 生成图表 → 写报告

核心差异在于:Agent 具备自主决策与执行能力,而不仅仅是文本生成。

Agent 的五大核心模块

一个成熟的 AI Agent 由以下五个模块组成:

1
2
3
4
5
6
7
8
9
┌─────────────────────────────────────────┐
│ AI Agent 架构 │
├─────────┬─────────┬──────────┬──────────┤
│ 规划 │ 记忆 │ 工具 │ 行动 │
│ Planning │ Memory │ Tools │ Action │
├─────────┴─────────┴──────────┴──────────┤
│ 大语言模型 (LLM) │
│ 大脑 / 推理引擎 │
└─────────────────────────────────────────┘

1. 大语言模型 — 大脑

LLM 是 Agent 的推理引擎,负责理解任务、拆解步骤、决策下一步做什么。2026 年主流选择:

  • Qwen 系列(通义千问):Qwen3.7-Plus / Max,阿里云百炼首选
  • GPT-4o / GPT-5:OpenAI 生态
  • Claude Opus 4.x:Anthropic 推理能力突出
  • DeepSeek:开源高性能模型

2. 规划(Planning)

Agent 收到任务后,不是直接执行,而是先做规划:

  • 任务分解:将复杂目标拆解为可执行的子任务
  • 路径选择:判断用哪种方式完成(直接计算?调用工具?查知识库?)
  • 动态调整:执行过程中根据中间结果修正计划

经典的 ReAct(Reasoning + Acting)模式就是规划的核心实现:思考 → 行动 → 观察 → 再思考,循环直到任务完成。

3. 记忆(Memory)

Agent 需要”记住”东西,分为两类:

  • 短期记忆:当前对话上下文,这次的用户需求、中间结果
  • 长期记忆:跨会话的信息,用户偏好、历史决策、知识积累

例如百炼的 Memory 服务,支持将对话中的重要信息持久化存储,下次对话时自动检索关联记忆。

4. 工具(Tools)

让 Agent 能”动手”的关键。常见工具类型:

工具类型 说明 示例
API 调用 调用外部服务 天气接口、股票数据、数据库查询
代码执行 运行代码片段 Python 沙箱执行数据分析
知识库检索 搜索私有文档 RAG 检索企业知识库
网页搜索 获取实时信息 搜索引擎 API
MCP 服务 标准化工具协议 文件系统、数据库、第三方服务

MCP(Model Context Protocol) 是 Anthropic 提出的标准化工具协议,阿里云百炼等平台已支持,让 Agent 能像 USB 一样”即插即用”各种工具。

5. 行动(Action)

Agent 的最终产出:一段文字回复、一个 API 调用结果、一份生成的报告、一次数据库操作等。

主流开发框架(2026)

1
2
3
4
5
6
7
8
9
10
11
12
13
graph TD
A[AI Agent 开发框架] --> B[轻量级/入门]
A --> C[工作流编排]
A --> D[多 Agent 协作]
A --> E[企业级平台]
B --> B1[OpenAI Agents SDK]
B --> B2[ReAct 手写]
C --> C1[LangGraph]
C --> C2[Spring AI Alibaba]
D --> D1[AutoGen]
D --> D2[CrewAI]
E --> E1[阿里云百炼]
E --> E2[Coze / 扣子]

入门推荐:ReAct 手写 → LangGraph

对于有后端的开发者,推荐的学习路径:

  1. 手写一个 ReAct Agent(50 行 Python)→ 理解 Agent 的本质
  2. 使用 LangGraph 做复杂工作流 → 掌握状态管理和条件路由
  3. 接入百炼平台 → 零代码构建 + 生产部署

框架对比

框架 定位 适合场景 学习曲线
OpenAI Agents SDK 轻量级 Agent 开发 快速原型、单 Agent
LangGraph 有状态工作流编排 复杂流程、多步骤推理 ⭐⭐⭐
AutoGen 多 Agent 对话协作 多角色协作、代码生成 ⭐⭐⭐
CrewAI 角色化多 Agent 模拟团队协作 ⭐⭐
阿里云百炼 企业级一站式平台 生产级应用、零代码构建

一个最简单的 Agent 示例

用 Python 手写一个 ReAct Agent,不到 50 行代码就能理解 Agent 的核心逻辑:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
import re

# 模拟 LLM 调用(实际开发中替换为 API 调用)
def llm(prompt):
# 这里简化处理:用正则匹配工具调用意图
if "天气" in prompt:
return "Thought: 我需要查询天气\nAction: get_weather[北京]\n"
elif "get_weather" in prompt:
return "Thought: 已获取天气数据\nAction: FINISH[北京今天晴,22°C,适合户外活动]\n"
return "Action: FINISH[无法处理该请求]\n"

def get_weather(city):
# 模拟天气查询工具
return f"{city}今天晴,22°C,适合户外活动"

def agent_loop(query):
"""Agent 主循环:ReAct 模式"""
prompt = f"用户问题: {query}\n"
max_steps = 5

for _ in range(max_steps):
response = llm(prompt)
print(f"[Agent] {response.strip()}")

# 解析 Action
match = re.search(r"Action: (\w+)\[(.*?)\]", response)
if not match:
break

action, args = match.group(1), match.group(2)

if action == "FINISH":
return args

if action == "get_weather":
result = get_weather(args)
prompt += f"Observation: {result}\n"

return "任务未完成"

# 运行
result = agent_loop("帮我安排明天北京户外活动")
print(f"\n最终结果: {result}")

输出:

1
2
3
4
5
6
[Agent] Thought: 我需要查询天气
Action: get_weather[北京]
[Agent] Thought: 已获取天气数据
Action: FINISH[北京今天晴,22°C,适合户外活动]

最终结果: 北京今天晴,22°C,适合户外活动

这就是 ReAct 的精髓:Thought → Action → Observation → Thought → Action → FINISH,一个循环直到任务完成。

百炼 Agent 开发快速上手

如果你用阿里云百炼平台,构建 Agent 更加简单:

三种开发模式

模式 面向人群 说明
零代码 业务人员 拖拽配置,选择模型 + 知识库 + 工具即可
低代码/工作流 技术产品 可视化编排工作流,定义条件分支和循环
API/SDK 开发者 代码调用,完全控制 Agent 行为

核心能力

  • 知识库:上传 PDF/Word/网页,Agent 自动检索回答
  • MCP 服务:一键接入标准化工具,无需管理运维
  • Memory:跨会话记忆,Agent 记住用户偏好和历史
  • Skill:可复用的能力模块,类似”Agent 的技能包”
  • Agent 2.0:自主规划 + 工具调用,解决复杂多步骤任务

系列文章规划

标题 内容
1 从概念到实践 ← 本文 Agent 核心概念、主流框架、简单示例
2 ReAct 与规划机制详解 深入 ReAct 原理、Prompt 工程、规划策略
3 工具调用与 MCP 协议 工具注册、MCP 标准化、自定义工具开发
4 Agent 记忆系统设计 短期/长期记忆、Memory 服务、向量检索
5 LangGraph 实战 有状态工作流、条件路由、多步骤编排
6 百炼 Agent 生产实践 企业级部署、性能优化、线上踩坑

下一篇预告:深入 ReAct 模式的 Prompt 工程和规划策略,手写一个完整的任务规划 Agent。

如果你也在做 Agent 开发,欢迎在评论区交流 💬