作者 / 来源:中智凯灵 / AiDD

——AiDD北京站测试与质量条线核心议题前瞻
8 月 21-22 日,第 10 届 AiDD 北京站将在北京举行。本届大会将围绕 AI + 开发、AI + 测试、AI + 工程、AI + 组织与流程、AI + 业务与需求五大方向展开,邀请来自字节跳动 TRAE、腾讯、阿里云、百度、美团、京东科技、华为、蚂蚁、中兴通讯、去哪儿、行云、商汤科技、货拉拉、快手、极狐 GitLab、优锘科技等企业与机构的一线专家,集中呈现 AI 原生软件工程的最新实践。本文将重点梳理测试与质量条线的核心议题。
当AI 开始大规模生成代码,研发组织很快会遇到一个新的瓶颈:代码可以更快地产生,但质量判断并不会自动变快。
传统软件面对的主要是确定性逻辑。输入相同,输出通常可预期;测试团队可以通过需求评审、用例设计、自动化执行和缺陷回归,逐步建立质量信心。但Agent 带来的,是另一类工程对象:它会理解上下文、调用工具、规划步骤、跨越多个系统完成任务,也可能因为提示、数据、环境和执行路径的变化,给出不同结果。
这意味着,测试不再只是验证“某段代码有没有Bug”,还要回答一组更难的问题:Agent 是否理解了真实意图?长程任务执行到第十步时会不会偏航?评测器本身是否可信?知识和规则能否被持续调用?权限、安全和失败回滚如何进入质量体系?一次Bad Case 被修复后,能否沉淀为下一次运行的护栏?
8 月 21-22 日,第 10 届 AiDD 北京站将在北京举行。从测试与质量条线议程看,这些问题正在汇聚成一条清晰的演进路线:从AI 辅助测试,到AI 自主测试;从用例生成,到端到端协同交付;从结果验收,到Agent 全生命周期评测;从单点工具,到知识、Harness 与质量治理共同组成的工程底座。
围绕这条主线,北京站设置了3 个“AI+测试”核心论坛,并通过2 个“AI+工程”关联论坛和 1 场会后深度工作坊,把测试工具、评测体系、ATDD、Harness Engineering 与AI 代码质量治理连接起来。
这不是给传统测试加一层大模型能力,而是在重新定义Agent 参与研发后的可信交付。

图1:AI 测试从规则自动化、智能辅助走向自主测试与持续质量治理
从"人工用例"到"Agent智能探索"的质量保障革命
出品人:Testin 云测
桂彬 (美团测试专家)将分享《自主测试,可信交付——Claw 框架交付流质量体系进化》。从题目里的“自主测试”和“可信交付”可以看到,关注点已经不只是让AI 帮测试人员完成某个动作,而是让质量能力进入交付流:Agent可以承担更完整的测试任务,但它的执行过程、产出结果和风险边界必须可验证;
高林林(中兴通讯 AI 应用资深专家)将带来《基于智研的 ATDD 端到端实践》,展示如何把验收测试驱动开发与 AI 工具链结合起来。议题将从需求澄清、用例生成、自动验证和反馈闭环展开,为测试团队提供一套从理念到工具落地的实践路径;
朱飞(京东智能测试平台负责人)将分享《从组件化到智能化:AI 驱动测试全链路落地实践》,则把视角放到平台和工具链。传统测试平台强调组件复用、流程编排和环境管理;智能化之后,平台还要处理上下文组织、任务规划、能力调用、结果反思和反馈回流。测试平台不再只是自动化工具的集合,而会逐渐成为多个测试Agent 协同工作的运行底座;
王枭(腾讯IEG 游戏渗透测试负责人)将分享《渗透之上:当安全质量进入Agent 新纪元》,补上了另一个不能回避的维度:安全质量。当Agent 能调用更多工具、访问更多上下文、执行更长链路的任务时,权限误用、越界访问、提示注入和工具链风险都会进入质量范围。测试与安全不再是两套后置检查,而要共同进入Agent 的设计、运行和审计过程;
神秘嘉宾(云测):将带来精彩议题。
五个议题勾勒出自主测试的基本条件:有清晰的验收标准,有可编排的测试能力,有端到端的执行闭环,也有安全与权限护栏。缺少其中任何一层,“自主”都可能只是把不确定性放大。
从“静态指标”到“Agent-as-a-Judge”的智能评测体系重构
出品人:郑丽君|美团 高级技术专家
如果说智能测试论坛关注“AI 如何参与测试”,8 月22 日上午的“大模型和AI 应用评测”论坛关注的则是另一个方向:AI 本身如何被测试。这是Agent 进入生产环境后最容易被低估的一层。
普通软件测试常常以功能正确性为中心;Agent 评测却要同时面对任务完成度、路径合理性、工具调用、上下文利用、事实准确性、成本、时延、安全性与稳定性。一个Agent 最终给出了正确答案,不代表它的过程可靠;一次任务完成,也不代表它在更多真实样本、异常输入和长链路条件下仍能稳定。
夏明(阿里云高级产品专家)将分享 《Agent 自进化:企业级智能体全生命周期进化飞轮实践》,讨论从观测、评估到优化的闭环。它指向一个重要变化:评测不再只是上线前的一次考试,而会贯穿Agent 的整个生命周期。运行数据暴露问题,评测体系识别差距,优化机制调整上下文、策略或工具,再通过新一轮运行验证改进,Agent 才可能从“可用”走向“越用越稳”。
罗钦玲(美团技术专家)将分享 《Agent-as-a-Judge 驱动的 AI 评测中台实践》,把问题推进到评测基础设施层。用大模型或Agent 做评审,可以扩大评测覆盖、降低人工抽检成本,但也会引出新的工程问题:评测标准如何定义?Judge 的判断如何校准?不同评测器之间如何交叉验证?怎样避免“用一个不稳定的AI,去证明另一个AI 很稳定”?
李睿琪(美团Agent 稳定性负责人)将分享《Agent 能干多大活?长程任务评测的工程实践与挑战》,聚焦任务视界变长后的稳定性。链路越长,早期偏差越可能累积,状态丢失、工具失败和目标漂移也越难发现。评测因此不能只看终点,还要检查中间状态、失败恢复和每一步是否仍服务于原始目标。
这三场议题共同回答的是:Agent 时代的评测,必须从“对结果打一个分”,升级为一套持续运行的质量系统。
第三条主线:智能测试工具的竞争,正在转向知识与工程底座
从“单点辅助”到“AI Native与知识驱动”的测试工具链重构
8月22 日下午,“智能测试工具开发与应用”论坛集中呈现测试工具如何从单点功能走向平台化和Agent 化。
出品人:丁向惠|京东云数字化效能部质量负责人
刘敏(北京兴云数科测试领域研发提效负责人)将分享 AI 驱动测试范式演进,从辅助到自主,构建端到端 AI 协同交付体系。议题将重点讨论 AI 如何参与测试设计、用例生成、执行分析和缺陷反馈,让测试从 “人手工补位” 走向 “AI 协同保障”; 刘须华(京东科技测试开发工程师)将介绍基于知识库驱动的 AI 测试平台 TestNexus。议题将聚焦测试知识沉淀与复用,解析企业如何通过知识库、上下文检索和 AI 推理,让测试平台具备更强的场景理解和自动生成能力; 赵丽艳(北银金科信息安全部部门负责人)将分享大模型驱动的需求到用例 AI 自动生成平台实践。议题将围绕需求理解、用例生成、覆盖分析和安全验证展开,帮助听众理解金融科技场景下如何用 AI 提升测试设计效率与质量一致性; 吴武辉(京东云高级测试专家)将解析复杂 ToB 业务场景下的 AI Native Test Harness 架构,以跨代码仓库知识图谱为知识底座。议题将回应大型企业系统测试中的复杂依赖、跨仓理解和场景验证难题,展示知识图谱与 Harness 如何支撑 AI 测试能力工程化落地。
由此可以看到,智能测试工具的下一阶段竞争,不只是“谁能生成更多用例”,而是谁能把知识、上下文、工具、规则和反馈变成一套可持续演进的测试运行环境。

赛道核心价值:覆盖 ATDD、AI 评测、测试平台、用例生成与质量闭环,帮助测试团队构建 “生成更快、验证更稳、治理更清晰” 的 AI 质量体系。
从“规格驱动”到“驾驭工程”的全链路质量治理新范式
测试与质量的变化,不只发生在“AI+测试”论坛,8 月22 日“AI+工程”方向的两场质量关联论坛:上午的“ATDD 实践及其AI 基础设施”和下午的“Harness Engineering(驾驭工程)”。
出品人:刘 涛|中兴通讯 资深AI算法专家
陈雅菲(中兴通讯资深软件架构师、资深敏捷教练、高级 AI 教练)将分享《知识消费驱动的 Spec 编写方法与实践》,讨论 AI 时代 UTDD/ATDD 的工程底座。议题将帮助听众理解,高质量需求和规格说明如何成为 AI 生成、测试和验证的基础输入,进而推动研发过程从 “写代码” 前移到 “编写可执行规格”;
张燚钧(中国移动云公司 AI 技术研究员)将分享《移动云基于 Harness 的 AI 原生开发实践》。议题将聚焦云服务研发场景中 AI 如何参与开发与验证过程,重点讨论 Harness 如何承载上下文、工具调用、过程约束和质量反馈,帮助 AI 真正进入工程交付链路。
孟一凡(某北美AI独角兽算法工程师)将分享《多 Agent 协同的软件工程实践:从架构设计到落地踩坑》,基于真实项目实践,提出一套"人类掌舵,智能体执行"的 Harness 工程体系,确保代码质量不被生成速度牺牲。
出品人:神秘嘉宾 敬请期待!
魏帅(北京火山动力网络技术高级架构师)将通过《 Claude Code + Superpowers 实战:如何把 AI 编码助手驯化为单人全栈生产力》。议题将不止停留在工具演示,而会关注提示、上下文、任务拆解、验证和迭代方式,帮助开发者形成可复用的 AI 编码工作流; 汤庆(北京奥星贝斯 OceanBase 技术专家)将分享《从静态检索到动态自进化:ContextSeek 如何让 Agent 持续提升》。议题将聚焦上下文质量对 Agent 能力的影响,讨论智能体如何通过持续反馈、知识更新和上下文优化不断提升任务表现; 郭涛(浪潮云计算研发技术负责人、高级架构师)将介绍《 Harness 工程在企业研发中的落地实践与效能提升》。议题将重点讨论企业如何通过 Harness 把模型能力、工具能力、上下文能力和验证机制组合起来,形成可控的 AI 工程体系; 贾澄臻(记忆张量测试负责人)将复盘《 Harness 驱动的质量闭环:一个 QA 在全员 AI Coding 团队中的实战》。议题把代码Diff 分析、契约检查、回归建议、缺陷定位、修复和验证压进同一套规则与门禁,让质量节奏跟上全员AI Coding。
两场论坛放在一起,ATDD、Spec 和Harness 不再是三个分散概念,而是开始汇合:
- Spec负责把业务意图和工程约束表达清楚;
- ATDD负责把意图变成可执行的验收标准;
- Harness负责让Agent 在工具、规则、环境和反馈约束下运行;
-评测与门禁负责判断结果是否达到可交付标准;
- Bad Case、测试经验和运行轨迹再回到知识与Skill,推动下一轮改进。
质量因此不再是研发链路末端的一道关,而会变成贯穿需求、设计、开发、测试、发布和运营的连续控制系统。
从听懂到带走:工作坊把“质量治理”落到工程防线
从“规格驱动”到“驾驭工程”的全链路质量治理新范式
「驾驭工程」深度工作坊(8月23日)
论坛回答趋势和实践,8 月23 日的会后深度工作坊则进一步回答:自主编程智能体的质量管控体系,如何在企业里真正搭起来。
由《软件工程3.0》作者、CCF 杰出会员、AiDD 技术委员会成员朱少民主讲的「驾驭工程」工作坊:《自主编程智能体质量管控体系——从失败模式到工程防线:让AI 代码“可控、可验证、可治理”》。
工作坊将围绕Harness Engineering 的“质量内核”、自主编程智能体的三大失败模式、四层防线质量治理,以及可观测性驱动的质量控制展开。
这组内容的价值,在于把抽象的“AI 代码质量”拆成可设计的工程机制。面对Agent,企业不能只依赖模型自觉,也不能把全部风险压到人工Review 上。更可靠的做法,是从任务定义、执行环境、工具权限、过程观测、验证门禁和审计回滚等不同层面设置防线,让错误尽可能早地暴露,让高风险动作被刚性约束,让每一次失败都能进入下一轮治理。
对于正在推动AI Coding 或Agent 落地的团队,工作坊把峰会中的多个议题收束成一套行动框架:先识别失败模式,再设计防线;先明确哪些结果必须验证,再决定哪些任务可以授权;先建立可观测和回滚机制,再扩大自主执行范围。
不同角色,应该带着什么问题来听?
如果你是测试或质量负责人,可以重点关注自主测试、AI 评测中台、长程任务评测和AI Native Test Harness。最值得带回组织的问题是:测试团队的核心资产,如何从个人经验转化为知识、Skill、评测集和门禁规则?
如果你是研发负责人,可以重点关注ATDD、Spec、端到端AI 协同交付和质量治理。需要判断的是:当AI Coding 让开发速度提升后,现有需求、评审、测试和发布流程中,哪一段会最先成为新瓶颈?
如果你在建设研发平台或工程效能平台,可以重点关注 TestNexus、用例生成平台、跨仓知识图谱、Agent-as-a-Judge 和 Harness。核心问题不是多接一个模型,而是平台能否提供统一上下文、工具协议、可观测性、评测回归和能力运营。
如果你正在做企业级Agent 或AI 原生应用,可以重点关注全生命周期进化飞轮、安全质量与长程任务稳定性。真正需要建立的,不只是一个效果更好的Demo,而是一套能持续证明“它为什么可以上线、为什么可以扩大权限”的证据链。
AI越能自主行动,质量越要成为系统能力
过去,测试常被视为交付前最后一道检查。Agent 时代,这个位置正在改变。
当AI 只做代码补全,质量问题还可以由开发者逐行审查;当Agent 开始理解需求、修改多个仓库、调用外部工具、执行测试并推进交付,质量就不能只靠最后一次验收。它必须进入Agent 的上下文、任务分解、工具权限、运行轨迹、评测标准、失败恢复和持续进化过程。
从北京站测试与质量条线可以看到,行业讨论已经越过“AI 能不能帮忙写用例”的阶段,开始进入更深的工程问题:
如何让测试Agent 自主工作,又不失去控制?如何评价一个会规划、会调用工具、会持续学习的系统?如何把业务知识、测试经验和失败案例沉淀为组织资产?如何通过Spec、ATDD 和Harness,把质量从结果检查变成过程约束?如何让AI 生成的代码可控、可验证、可治理?
这些问题需要测试、开发、架构、平台、安全和管理者共同设计新的质量体系。
2026年8 月21-22 日,第10届AiDD AI+研发数字峰会北京站,将通过3 个“AI+测试”论坛和2 个“AI+工程”关联论坛,系统讨论智能测试、AI 评测、ATDD、Harness 与质量治理;8 月23 日,会后深度工作坊还将拆解自主编程智能体的质量管控体系。
AI越能自主行动,企业越需要把质量做成系统能力。
从辅助到自主,变化的不只是测试工具,而是软件交付对“可信”的定义。
