课程大纲
深入理解Test4AI必须具备的LLM知识体系
l LLM应用能力的进阶模型(“倒三角”模型)
l 提示的万能使用公式详解
l 提示词模板的使用
l 提示词静态链的使用
l 使用OpenAI API
l ReAct的概念和落地
l 思维链和多思维链
l RAG的基本原理与应用
l 多模态RAG的使用
l plugin机制与使用方式
l Function Call机制与使用方式
l MCP机制与使用方式
l Skill机制与使用方式
深入理解Test4AI必须具备的Agent知识体系
l Agent的雏形
l Agent开发的基本框架
l 业界主流Agent的设计思路与使用
l 知识工程的设计
l Harness Engineering的设计
l Multi-Agent的雏形
l 业界主流Multi-Agent的设计思路
l 多Agent任务调度策略与选型
l Agent设计模式与选择
l Multi-Agent的基本逻辑和应用范围
l Multi-Agent应用示例:MetaGPT
l Multi-Agent应用示例:DevChat
l Agent设计模式:顺序执行链模式与案例详解
l Agent设计模式:路由模式与案例详解
l Agent设计模式:并行模式与案例详解
l Agent设计模式:反思模式与案例详解
l Agent设计模式:工具使用模式与案例详解
l Agent设计模式:规划模式与案例详解
l Agent设计模式:多智能体协作模式与案例详解
l Agent设计模式:人类参与模式与案例详解
l Agent设计模式:短期记忆管理模式与案例详解
l Agent设计模式:长期记忆管理模式与案例详解
Test4AI(AI原生应用如何进行测试)技术与行业成功案例
l 从“测试”到“评测”
l 模型评测的技术概览
l 模型评测的基本方法
l AI原生应用评测的技术概览
l AI原生应用评测的基本方法
l AI原生应用评测的“可验证性”理论
l AI原生应用评测的特殊性和难点
l 区分模型能力和Agent能力
l AI原生应用评测的完整流程
l AI原生应用评测的数据集准备
l AI原生应用质量全生命周期的扩展
l AI原生应用评测的业界前沿实践
l AI原生应用评测的发展方向
l 企业级案例:LLM辅助编程工具的评测与质量控制
l 企业级案例:智能客服系统的评测与质量控制
大模型和Agent能力评测的道法术器
l 大模型评测和Agent评测的区别
l 大模型和Agent能力评测的基本流程
l 目前主流评测手段的主要问题
l 评测的数据污染问题
l 数据污染的处理手段和保鲜机制
l 评测的数据饱和问题
l 数据饱和程度的感知方式
l 评测的数据简化问题
l 评测的任务分类体系问题
l 评测的难度等级问题
l 评测数据的自动生成
l 大模型能力评测维度
l Agent能力评测维度
l Agent反向提问能力评测
l 评测数据集与基准建设
l 评测数据集的结构设计
l 从真实数据泛化衍生新数据的方法
l 评测指标与评价标准的设计原则
l 常见评测指标设计思路解读
l 自动评测的局限与业界常见误区
l 人工手动评测的必要性
l 评测运行基础设施的架构设计
l 案例解读:SWE-Bench和SWE-Bench-Verified的设计
l 案例解读:软件研发全生命周期的LLM应用能力评测
l 案例解读:国内某互联网大厂的Agent评测体系设计
AI原生应用质量保障的最佳实践与案例解读
l 从“测试”到“评测”
l AI原生应用的软件质量范畴衍生
l 非确定性的技术围栏
l 模型评测之外的质量保障
l 用魔法打败魔法的实践
l AI原生应用质量保障的特殊性和难点
l AI原生应用质量保障技术概览
l AI原生应用质量保障的基本方法
l AI原生应用质量保障的“可验证性”理论
l 区分模型能力和Agent能力
l AI原生应用评测的完整流程
l AI原生应用评测的数据集准备
l AI原生应用质量全生命周期的扩展
l AI原生应用评测的业界前沿实践
l AI原生应用评测的发展方向
l 企业级案例:LLM辅助编程工具的评测与质量控制
l 企业级案例:智能客服系统的评测与质量控制


