ADEPT: A Unified Framework for Deep Learning Test Adequacy
复现一类DL测试度量要配数天:ADEPT用一套YAML框架把五类全部跑通:如果你需要在同一个模型上比较神经元覆盖、惊异充分性等多类测试充分性度量,过去的做法是逐一配置异构原型,单个就要花数天到数周——这正是工业访谈确认的真实门槛。ADEPT用一个统一框架消除这道摩擦:模板接口、预处理缓存、YAML配置,五类度量一次声明、端到端执行。
DL测试充分性度量长期以异构原型发布、单个复现常需数天至数周,ADEPT通过统一工作流与YAML配置把五类度量整合为可直接调用的框架。演示验证五类度量在单一框架下端到端执行,工业访谈支持高采用门槛为真实痛点。
五类异构DL测试充分性度量可以被整合为统一框架:ADEPT通过模板接口、预处理缓存与YAML配置,使研究者无需数天搭建即可复现和比较这些度量;支撑证据是架构演示与工业访谈。
1. 旧缺口:五类度量各自发布为独立原型,预处理依赖差异大(KMNC要训练集激活剖析、惊异充分性要密度估计、分布覆盖要独立编码器),工业访谈确认单个复现或部署需数天至数周,跨度量比较几乎不可行。 2. 方法与控制:ADEPT用四层架构统一执行——模板接口、度量专属预处理、跨次复用的缓存、评分报告层,YAML消除各原型的异构启动步骤,缓存消除重复预处理。 3. 结果与行动:五类度量已在单一工作流下端到端跑通;需要多度量对比时直接用统一框架,但注意摘录未给出定量精度对比与运行时开销,扩展边界取决于新度量能否适配模板接口。
论文发表于SPLASH Companion '26,是6页工具展示类论文,未设置标准基准数据集对比实验。有效性依据为两类:工业DNN从业者访谈(确认现有工具因流程异构与高门槛难以使用)和演示视频(展示五类度量端到端执行)。摘录未提供跨度量精度对比、运行时开销数据或得分分布结果,扩展性与泛化边界尚无定量刻画。
- 它要解决什么
- 五类DL测试充分性度量各自以异构原型发布,复现或部署单个度量需数天乃至数周——能否用一个统一框架消除这一工程摩擦?
- 研究路径
- 用户在YAML中声明目标度量列表与测试集路径。ADEPT激活对应预处理模块:KMNC加载训练集并剖析激活分布,惊异充分性提取激活轨迹并拟合密度模型,分布覆盖调用预训练编码器提取特征。中间制品写入缓存供后续复用,评分组件对测试集计算充分性得分并生成含执行元数据的结构化报告。
- 这对工程意味着什么
- 第一行动:需要在同一模型或数据集上比较多类充分性度量时,直接用ADEPT这类统一框架加YAML声明,靠缓存层消除重复预处理,而不是逐一配置原型。要避开的捷径:不要把"框架执行通过"当成"度量在当前任务上语义有效"——接口统一不代表度量适用性已获验证。
- 证据定位
- 证据有两类。一是工业DNN从业者访谈:现有度量工具因流程异构、采用门槛高而难以实际使用。二是演示视频:五类度量在单一工作流下端到端执行并输出结构化报告。需要说明:论文摘录未提供跨度量定量对比实验,有效性主要依据架构演示与访谈。(筛选维度:可复核评测)
- 适用边界
- 论文为6页工具展示,未提供充分性度量与模型泛化能力之间的定量关联实验;有效性证据依赖演示与工业访谈,未经受控基准验证;框架覆盖的五类度量为作者选择,可能未涵盖全部工业相关度量类别。
方法与英文摘要
ADEPT整合五类度量:神经元覆盖(KMNC需对训练集做激活剖析)、惊异充分性(激活轨迹提取与密度估计)、输入分布覆盖(依赖独立训练的编码器)、边界覆盖、源级与模型级变异得分。框架分四层:模板化度量接口提供扩展点;度量专属预处理模块生成中间制品;缓存组件跨次复用制品;评分组件输出得分与元数据报告。全流程由YAML配置驱动。
Over the past decade, many test adequacy metrics have been proposed for deep learning that characterize test dataset adequacy from different perspectives, e.g., neuron activation behavior, latent feature coverage, decision-boundary exploration, etc. However, these metrics are typically released as independent research prototypes with substantially different installation and preprocessing requirements, execution workflows, and configuration mechanisms. These complications make them quite difficult to reproduce, compare, and adopt in research work and practical deployment alike. In this paper, we present the engineering details of ADEPT, a framework that integrates representative adequacy techniques, including neuron-coverage-based metrics, surprise adequacy, input distribution coverage, boundary coverage, and source- and model-level mutation score, under a consistent execution workflow. ADEPT provides a template-based metric interface with well-defined extension points for integrating new adequacy metrics. Furthermore, it provides YAML-based configuration management, preprocessing-cache reuse, and structured result reporting, making it easy to use in any research and development workflows. ADEPT is designed for researchers and practitioners who wish to reproduce and apply adequacy metrics without spending days or weeks implementing missing tooling or configuring disparate research prototypes. A demo video is available at https://aub.ie/ADEPT_video.