4006-998-758
3000+课程任你选择
Test4AI 技术方法与实战案例
研发学院 Test4AI 技术方法与实战案例
Jack Miao
  • 业界知名实战派研发效能(软件工程)和软件质量双领域专家,在国内外各大技术峰会担任联席主席,技术委员成员和出品人

  • 国内第一本多模态大模型书籍的作者,国内最早的大模型应用领域的一线实践者和布道者

  • 硅谷先进研发效能理念在国内的技术布道者,互联网行业研发效能提升领域的技术先行者

  • 大语言模型LLM在软件研发领域应用与落地的先行者

  • 测试基础架构和测试中台建设的技术布道者与实践者

  • “研发效能宣言“发起人和主要起草人

● 腾讯研究院 特约研究员

● 腾讯Tech Lead

● 腾讯集团技术委员会委员

● 腾讯管理干部技术领导力建设核心讲师

● 腾讯CTO领航营特聘讲师

● 腾讯研究院AIGC行业研究专项 特聘技术专家

● 腾讯学堂AIGC和LLM行业应用进阶特聘讲师

● 腾讯投后企业技术高管技术领导力课程核心讲师

● 中国计算机学会(CCF) TF 研发效能SIG 主席

● 国务院发展研究中心AIGC应用 特约访谈专家

● 中国信息通信研究院“LLM智能化软件工程”年度贡献专家

● 中国通信标准化协会TC608云计算标准和开源推进委员会云上软件工程工作组副组长

● IEEE 智能化软件工程标准的撰写人之一

● 年度IT图书最具影响力作者(与吴军同时获奖)

● 22年23年连续两年获得 中国信通院软件工程领域年度十大突出贡献专家

● 年度IT技术领导力年度互联网行业测试领域技术专家

● 中国商业联合会 互联网应用技术委员会 智库专家

● 腾讯云架构师技术同盟入会发展主席

● 畅销书《多模态大模型:技术原理与实战》作者

● 台湾繁体图书《多模态+大模型实作精讲》作者

● 《大模型驱动的软件测试:从理论到实践》译者

● 《构建Agentic AI系统:打造能推理、可规划、自适应的AI智能体》译者

● 《智能体设计模式:构建Agentic系统实践》译者(即将出版)

● 《因果 AI》译者(即将出版)

● 《AI Agents in Action》译者(即将出版)

● 《Engineering AI System》译者(即将出版)

● 《AI赋能的数据科学:基于LLM的多模态数据分析》译者(即将出版)

● 腾讯云最具价值专家TVP,阿里云最具价值专家MVP,华为云最具价值专家MVP

● 业界第一本研发效能领域专著《软件研发效能提升之美》作者

● 畅销书《软件研发效能提升实践》作者

● 畅销书《软件研发效能权威指南》主编

● 畅销书《测试工程师全栈技术进阶与实践》作者

● 畅销书《高效自动化测试平台:设计与开发实战》作者

● 畅销书《现代软件测试技术之美》作者

● 新书《高质效交付:软件集成、测试与发布精进之道》

● 新书《软件研发行业创新实战案例解析》主编

● 新书《现代软件测试技术权威指南》

● 译作《整洁架构之道(中文新版)》

● 译作《软件设计的哲学(第2版)》

● 译作《DevOps实践指南(第2版)》

● 译作《持续架构实践:敏捷和DevOps时代下的软件架构》

● 译作《现代软件工程:如何高效构建软件》

● 译作《精益DevOps》

● 译作《基础设施即代码:模型驱动的DevOps》

● 译作《计算机科学通识:计算思维培养与多学科问题解决实践》

● 硅谷架构经典教程《软件架构实践(第4版)》技术审校

● 《软件开发中的决策:权衡与取舍》技术审校

● InfoQ极客时间《软件测试52讲-从小工到专家的实战心法》作者

● 《研发质量保障与工程效能》作者之一

● 团体标准“软件研发效能度量规范“核心编写专家

● 信通院“DevOps能力成熟度模型”核心编写专家

● 技术白皮书“研发效能实践指南“主编

● 技术白皮书“软件测试技术趋势白皮书“指导委员会委员

● 技术白皮书“数字化时代质量工程白皮书“编写委员会成员

● “2022研发效能实践案例智库集“主编

● Certified DevOps Enterprise Coach课程设计者

● “中国数字经济发展观察报告”作者之一

● 西南科技大学 计算机科学与技术学院 研究生导师

● 南京大学 软件学院 企业讲师

● 中国移动通信联合会ICT领域专家级讲师认证

查看老师详情
课程内容

课程大纲

深入理解Test4AI必须具备的LLM知识体系

l LLM应用能力的进阶模型(“倒三角”模型)

l 提示的万能使用公式详解

l 提示词模板的使用

l 提示词静态链的使用

l 使用OpenAI API

l ReAct的概念和落地

l 思维链和多思维链

l RAG的基本原理与应用

l 多模态RAG的使用

l plugin机制与使用方式

l Function Call机制与使用方式

l MCP机制与使用方式

l Skill机制与使用方式

 

深入理解Test4AI必须具备的Agent知识体系

l Agent的雏形

l Agent开发的基本框架

l 业界主流Agent的设计思路与使用

l 知识工程的设计

l Harness Engineering的设计

l Multi-Agent的雏形

l 业界主流Multi-Agent的设计思路

l 多Agent任务调度策略与选型

l Agent设计模式与选择

l Multi-Agent的基本逻辑和应用范围

l Multi-Agent应用示例:MetaGPT

l Multi-Agent应用示例:DevChat

l Agent设计模式:顺序执行链模式与案例详解

l Agent设计模式:路由模式与案例详解

l Agent设计模式:并行模式与案例详解

l Agent设计模式:反思模式与案例详解

l Agent设计模式:工具使用模式与案例详解

l Agent设计模式:规划模式与案例详解

l Agent设计模式:多智能体协作模式与案例详解

l Agent设计模式:人类参与模式与案例详解

l Agent设计模式:短期记忆管理模式与案例详解

l Agent设计模式:长期记忆管理模式与案例详解

 

Test4AI(AI原生应用如何进行测试)技术与行业成功案例

l 从“测试”到“评测”

l 模型评测的技术概览

l 模型评测的基本方法

l AI原生应用评测的技术概览

l AI原生应用评测的基本方法

l AI原生应用评测的“可验证性”理论

l AI原生应用评测的特殊性和难点

l 区分模型能力和Agent能力

l AI原生应用评测的完整流程

l AI原生应用评测的数据集准备

l AI原生应用质量全生命周期的扩展

l AI原生应用评测的业界前沿实践

l AI原生应用评测的发展方向

l 企业级案例:LLM辅助编程工具的评测与质量控制

l 企业级案例:智能客服系统的评测与质量控制

 

大模型和Agent能力评测的道法术器

l 大模型评测和Agent评测的区别

l 大模型和Agent能力评测的基本流程

l 目前主流评测手段的主要问题

l 评测的数据污染问题

l 数据污染的处理手段和保鲜机制

l 评测的数据饱和问题

l 数据饱和程度的感知方式

l 评测的数据简化问题

l 评测的任务分类体系问题

l 评测的难度等级问题

l 评测数据的自动生成

l 大模型能力评测维度

l Agent能力评测维度

l Agent反向提问能力评测

l 评测数据集与基准建设

l 评测数据集的结构设计

l 从真实数据泛化衍生新数据的方法

l 评测指标与评价标准的设计原则

l 常见评测指标设计思路解读

l 自动评测的局限与业界常见误区

l 人工手动评测的必要性

l 评测运行基础设施的架构设计

l 案例解读:SWE-Bench和SWE-Bench-Verified的设计

l 案例解读:软件研发全生命周期的LLM应用能力评测

l 案例解读:国内某互联网大厂的Agent评测体系设计

 

AI原生应用质量保障的最佳实践与案例解读

l 从“测试”到“评测”

l AI原生应用的软件质量范畴衍生

l 非确定性的技术围栏

l 模型评测之外的质量保障

l 用魔法打败魔法的实践

l AI原生应用质量保障的特殊性和难点

l AI原生应用质量保障技术概览

l AI原生应用质量保障的基本方法

l AI原生应用质量保障的“可验证性”理论

l 区分模型能力和Agent能力

l AI原生应用评测的完整流程

l AI原生应用评测的数据集准备

l AI原生应用质量全生命周期的扩展

l AI原生应用评测的业界前沿实践

l AI原生应用评测的发展方向

l 企业级案例:LLM辅助编程工具的评测与质量控制

l 企业级案例:智能客服系统的评测与质量控制

 

 

 



返回上一级