课程大纲
第一天:设计高质量Agent
模块一:如何设计一个高质量的 Agent
Agent演化:从聊天机器人到解决真实问题
应用形态演进:聊天机器人 → RAG 与工作流 → Agent → 具身智能
破除 Agent 的开发误区
误区:一拥而上的 Agent 带来各种问题
根因:缺乏系统化的设计方法
决策:从业务开始考虑
Agent 开发全景图
Agent 的大脑:提示工程
Agent 的神经系统:编排模式
Agent 的手脚:能力体系
Agent 的知识库:上下文工程
Agent 的免疫系统:Harness工程
模块二:如何让 Agent 的大脑更好地思考
Agent 如何思考:用提示词引导 Agent 思考
Agent 提示词设计的误区:太少 / 关注点过多 / 指令模糊
提示词的核心作用:引导大模型进行思考
从提示词到提示工程:从能思考到会思考
Agent 的提示词布局:结构化设计
结构化设计
不同部分提供不同信息
常见组成部分:系统提示 / 角色 / 分隔符 / 结构化输出
Agent 提示词布局
提示词缓存:降低计算成本、提升响应速度
提示词动静分离:充分利用提示词缓存
让 Agent 更好地思考
推理引导技术:让 Agent 更好地思考
思维链(CoT);深度思考本质是内部 CoT
自我一致性 / 后退提示 / 思维树(ToT)
模块三:如何为 Agent 设计工作流程
为什么要开发自己的 Agent
领域相关的工作流和数据
如何为 Agent 设计工作流程
任务分解:将 Agent 的工作过程进行拆解
设计工作流:将工作过程重新组织
编排模式:行业中的 Agent 工作流程最佳实践
提示链/路由/并行/反思/规划/人机协同
从需求到工作流:识别模式 → 绘制工作流图 → 决定每个节点用代码还是 Agent
模块四:Skill:让 Agent 的能力越来越强
工具:从聊天到工作
工具调用的流程
MCP:工具的标准化
从各自为战到统一标准
MCP是如何工作的
Agent Skill:从封装工具到封装实践
Agent Skill:一种给 AI Agent 添加新能力的标准方式
Skill的业务价值:将"专家经验"转化为"可复用的标准作业程序"
渐进式披露:Skill的核心原则
Skill 的基本结构
SKILL.md:核心文件
Skill 的文件引用
scripts:执行脚本
references:引用文档
assets:模板、资源
安装 Skill
Skill 仓库:Skill 聚合体
手工安装 Skill
通过 skills 命令安装
运行 Skill
在 Claude Code 运行 Skill
在 OpenClaw 运行 Skill
在 VS Code 运行 Skill
开发 Skill
识别筛选 → 拆解建模 → 编写 SKILL.md → 辅助脚本 → 优化迭代
核心原则:脚本做确定性的事,AI做需要理解的事
第二天:Agent 工程化
模块五:如何让 Agent 知道更多事情
大模型的局限性
有限的知识:不是无所不知
有限的上下文窗口:不能处理过长的内容
无状态服务:不知道发生过的事情
如何让 Agent 知道更多
在运行时,告诉 Agent 应该知道的信息,也就是把上下文告诉 Agent
上下文本质上是一种动态提示词,在Agent 执行过程中实时组装。
把 Agent 当作一个实习生,你决定它该看什么、先看哪段、记下什么
让 Agent 更了解你的业务:知识上下文
确定检索来源:非结构化文本、结构化数据、网络搜索、API;混合检索
何优化检索信息:Garbage In Garbage Out、文本分块
如何对检索过程进行优化:查询重写、重排序
RAG 技术的演进:传统 / GraphRAG / Agentic RAG
如何让 Agent 记住你:记忆上下文
短期记忆
在上下文窗口内的记忆
全量历史 → 滑动窗口 → 摘要,及其各自局限
长期记忆
跳出上下文窗口
四层架构(写入 / 存储 / 检索 / 管理),存储分 Core / Recall / Archival
如何规划有限的上下文窗口
为什么要规划上下文窗口:Lost in the Middle:注意力两头强、中间弱
管理上下文就是资源调度:重要的内容优先级更高
常见的上下文管理技术:上下文压缩、渐进式披露、提示词缓存
模块六:如何让 Agent 稳定地运行
为什么 Agent 一上生产就会出问题
Demo 能跑 ≠ 生产能跑:出错、失控、不可见、被攻击
不确定性来自核心本身(LLM)
从能跑通到敢上线:Harness 工程
可靠(兜底)/ 安全(守底线)/ 可控(人接管)/ 可观测(看得见)
可靠:出错也能兜住
不可靠的两类原因:传统工程问题 + 大模型专属问题(幻觉、工具误用、死循环)
目标不是不犯错,而是有退路:能恢复、能降级、受控失败
异常处理三阶段:检测 → 处理 → 恢复
幻觉:可靠性最大的挑战
Grounding:管住幻觉,让回答有据可依
安全:让 Agent 别闯祸
危险来源:工具和大模型自身;无意的和有意的
免疫系统:护栏,不是"限制 Agent 的能力",而是"确保它稳健、可靠、有益"
六层防御:输入 / 输出 / 行为 / 能力约束 / 审核 API / 人机协同
最小权限、小模型守门;合规是国内底线
可控:关键处人来拍板
为什么不能完全自主:模型自身靠不住,而且有些事本来就该人做
自主三个层级:全自主 / 半自主 / 人在环
何时需要有人介入:关键节点
人在环内 vs人在环上:⻛险高,需要人在 AI的工作流程内,反之,人在流程上监控即可
可观测:干了什么看得见
监控是传统服务最基础的功能
Agent"测不准":离线 / 在线 × 输出 / 轨迹,四个维度
Agent 观测的三件武器:离线评估 / 在线监控 / Trace
附加:⾦融领域的 Agent
现状与趋势:从辅助工具到"数字员工"
定位升级:从给人打下手,到自己能干活
三大趋势:AI 基础设施化、Agent 应用深化、人机协同是主流
核心场景:Agent 在⾦融⾥能干什么
投研助手:重塑投研流程,7×24 研究覆盖(多 Agent + RAG)
智能合规:事前预防,7×24 审核(护栏 + 人机协同)
量化投资:因子挖掘、策略生成、组合⻛控(多 Agent 协同)
智能客服与营销:千人千面,秒级响应
海外标杆:大行是怎么做的
摩根大通 / 贝莱德 / 高盛,AI 已是核心战略
探索在继续
长时间运行且自主运行的 Agent
分析师与AI协同工作的工作流
怎么落地:构建指南
技术栈与生态
金融工具与 Skill 生态
知识方案:RAG vs 微调
监管三级权限:用户决策、用户授权、Agent 自主决策
数据安全:金融机构的生命线
怎么衡量:评估与迭代
ROI 与效率
金融评测基准:FinGAIA / FinEval 等
安全治理评测:FinVault


