公开论文雷达

公开 arXiv 研究简报 · 2026-08-17T00:43:25.389457+00:00

先看结论和关键数字,再决定要不要读原文。候选只在首次出现时展示;旧候选若后来通过深读门槛,仍会进入重点。

两张卡都在给"能跑通"补一道资格闸

GPM要解决的是代理记忆检索到就敢对外断言的问题,用双时态账本和五条失败关闭契约在排序前加资格闸,证据是哈希冻结基准与密封服务评测。ADEPT解决的是五类DL测试度量各自异构、复现要数天的工程摩擦,用YAML统一框架跑通,证据是架构演示加工业访谈。前者证据密、验证严,后者只到演示阶段。

推荐阅读顺序

  1. 2608.12476:先读它:把"检索到"和"有资格说"分成两件事,这个判断能直接改你现在的记忆管道设计,且带可核验的基准数字。
  2. 2608.12144:后读它:定位是六页工具展示,讲的是统一框架消除复现摩擦,读它是为了看工程整合手法,别指望度量有效性数据。
共性方法
两者都在原有"能返回结果"的流程上补一层前置约束:GPM在排序前加公开资格投影,ADEPT在异构原型前加统一接口与缓存。都点名了一个被现有做法忽略的门槛——一个是释放合规没人测,一个是复现成本没人算。
关键分歧
证据强度差一个量级。GPM给出哈希冻结3600用例、密封服务2400/2400对600/2400的可核对数字,验证做到了合约级;ADEPT只有架构演示和工业访谈,摘录里没有任何跨度量定量对比或开销数据,有效性尚未受控验证。
选择准则
要落地记忆释放控制、需要可审计的合规切入点,读GPM并照它设计资格闸;只是想少花时间同时跑多类DL充分性度量,用ADEPT但别把"框架跑通"当成度量有效。

重点深读(2 / 2 篇)

形式化与程序验证(0 篇)

本轮没有通过深读证据门的重点论文。

软件工程与仓库智能(1 篇)

软件工程与仓库智能 4/30

ADEPT: A Unified Framework for Deep Learning Test Adequacy

复现一类DL测试度量要配数天:ADEPT用一套YAML框架把五类全部跑通:如果你需要在同一个模型上比较神经元覆盖、惊异充分性等多类测试充分性度量,过去的做法是逐一配置异构原型,单个就要花数天到数周——这正是工业访谈确认的真实门槛。ADEPT用一个统一框架消除这道摩擦:模板接口、预处理缓存、YAML配置,五类度量一次声明、端到端执行。

两句看懂

DL测试充分性度量长期以异构原型发布、单个复现常需数天至数周,ADEPT通过统一工作流与YAML配置把五类度量整合为可直接调用的框架。演示验证五类度量在单一框架下端到端执行,工业访谈支持高采用门槛为真实痛点。

核心判断

五类异构DL测试充分性度量可以被整合为统一框架:ADEPT通过模板接口、预处理缓存与YAML配置,使研究者无需数天搭建即可复现和比较这些度量;支撑证据是架构演示与工业访谈。

关键要点

1. 旧缺口:五类度量各自发布为独立原型,预处理依赖差异大(KMNC要训练集激活剖析、惊异充分性要密度估计、分布覆盖要独立编码器),工业访谈确认单个复现或部署需数天至数周,跨度量比较几乎不可行。 2. 方法与控制:ADEPT用四层架构统一执行——模板接口、度量专属预处理、跨次复用的缓存、评分报告层,YAML消除各原型的异构启动步骤,缓存消除重复预处理。 3. 结果与行动:五类度量已在单一工作流下端到端跑通;需要多度量对比时直接用统一框架,但注意摘录未给出定量精度对比与运行时开销,扩展边界取决于新度量能否适配模板接口。

证据与结果

论文发表于SPLASH Companion '26,是6页工具展示类论文,未设置标准基准数据集对比实验。有效性依据为两类:工业DNN从业者访谈(确认现有工具因流程异构与高门槛难以使用)和演示视频(展示五类度量端到端执行)。摘录未提供跨度量精度对比、运行时开销数据或得分分布结果,扩展性与泛化边界尚无定量刻画。

打开论文原文
它要解决什么
五类DL测试充分性度量各自以异构原型发布,复现或部署单个度量需数天乃至数周——能否用一个统一框架消除这一工程摩擦?
研究路径
用户在YAML中声明目标度量列表与测试集路径。ADEPT激活对应预处理模块:KMNC加载训练集并剖析激活分布,惊异充分性提取激活轨迹并拟合密度模型,分布覆盖调用预训练编码器提取特征。中间制品写入缓存供后续复用,评分组件对测试集计算充分性得分并生成含执行元数据的结构化报告。
这对工程意味着什么
第一行动:需要在同一模型或数据集上比较多类充分性度量时,直接用ADEPT这类统一框架加YAML声明,靠缓存层消除重复预处理,而不是逐一配置原型。要避开的捷径:不要把"框架执行通过"当成"度量在当前任务上语义有效"——接口统一不代表度量适用性已获验证。
证据定位
证据有两类。一是工业DNN从业者访谈:现有度量工具因流程异构、采用门槛高而难以实际使用。二是演示视频:五类度量在单一工作流下端到端执行并输出结构化报告。需要说明:论文摘录未提供跨度量定量对比实验,有效性主要依据架构演示与访谈。(筛选维度:可复核评测)
适用边界
论文为6页工具展示,未提供充分性度量与模型泛化能力之间的定量关联实验;有效性证据依赖演示与工业访谈,未经受控基准验证;框架覆盖的五类度量为作者选择,可能未涵盖全部工业相关度量类别。
方法与英文摘要

ADEPT整合五类度量:神经元覆盖(KMNC需对训练集做激活剖析)、惊异充分性(激活轨迹提取与密度估计)、输入分布覆盖(依赖独立训练的编码器)、边界覆盖、源级与模型级变异得分。框架分四层:模板化度量接口提供扩展点;度量专属预处理模块生成中间制品;缓存组件跨次复用制品;评分组件输出得分与元数据报告。全流程由YAML配置驱动。

Over the past decade, many test adequacy metrics have been proposed for deep learning that characterize test dataset adequacy from different perspectives, e.g., neuron activation behavior, latent feature coverage, decision-boundary exploration, etc. However, these metrics are typically released as independent research prototypes with substantially different installation and preprocessing requirements, execution workflows, and configuration mechanisms. These complications make them quite difficult to reproduce, compare, and adopt in research work and practical deployment alike. In this paper, we present the engineering details of ADEPT, a framework that integrates representative adequacy techniques, including neuron-coverage-based metrics, surprise adequacy, input distribution coverage, boundary coverage, and source- and model-level mutation score, under a consistent execution workflow. ADEPT provides a template-based metric interface with well-defined extension points for integrating new adequacy metrics. Furthermore, it provides YAML-based configuration management, preprocessing-cache reuse, and structured result reporting, making it easy to use in any research and development workflows. ADEPT is designed for researchers and practitioners who wish to reproduce and apply adequacy metrics without spending days or weeks implementing missing tooling or configuring disparate research prototypes. A demo video is available at https://aub.ie/ADEPT_video.

代码质量与优化(0 篇)

本轮没有通过深读证据门的重点论文。

UI 与 GUI Agent(0 篇)

本轮没有通过深读证据门的重点论文。

个人知识与本体(1 篇)

个人知识与本体 9/30

Governed Persistent Memory: Source-Bound State Semantics and Fail-Closed Release for Long-Horizon Agents

检索到不等于有资格说:GPM给代理记忆加上失败关闭的释放契约:如果你的长期代理记忆只靠相关性排序来决定说什么,已撤销、已删除或相互冲突的记录照样会被当作事实对外断言。GPM在排序之前插入一层公开资格判断,用双时态来源绑定账本和五条可执行契约做失败关闭释放,在3600用例基准上全匹配,密封服务评测中受治理通道2400/2400,而无治理的7B对照只有600/2400。

两句看懂

传统检索管道拿相关性排序代替公开资格判断,冲突、撤销或删除的记录可以绕过控制支撑对外断言,GPM用双时态来源绑定账本和五条失败关闭契约堵上这个缺口。哈希冻结的3600用例基准上GPM全匹配,V3密封服务评测中受治理通道2400/2400正确,无治理7B对照600/2400,修复率100%,95%下界超99.8%。

核心判断

持久记忆系统必须把公开资格判断放在相关性排序之前。GPM用双时态来源绑定账本和五条可执行契约实施失败关闭释放,密封服务评测中受治理通道2400/2400正确,无治理7B对照只有600/2400。

关键要点

1. 旧假设与失败:传统管道把相关性排序当成公开资格,拦不住冲突、已撤销、已删除的记录;一次提取错误还会被循环召回写回,伪装成稳定历史,而现有基准只衡量检索质量,不衡量释放合规。2. 方法与受控检验:GPM在排序前加公开投影和证词投影过滤候选集,释放时按五条契约失败关闭;检验用哈希冻结的3600用例(含隐藏反事实和三种配套完整策略上界),加密封端到端服务评测(V3/V5两轮封存、8类查询族、中英文指令臂、无治理7B对照),并把确定性服务输出与语言模型开放世界精度分开报告。3. 决定性结果与做法:GPM基准全匹配(最优简单策略仅1800/3600),V3/V5臂均2400/2400、修复全部1800个基线失败且无回归;工程上应把资格投影层插在排序之前,未过契约的候选集整体拒绝而非降级输出。

证据与结果

GPM-ReleaseBench v1为内部设计:哈希冻结3600用例,含评测方隐藏的反事实用例和三种配套完整策略;GPM全匹配,最优简单策略1800/3600,在50%违规用例上释放不匹配。密封端到端服务评测覆盖8类查询族和真实摄入、释放服务:V3臂受治理2400/2400,无治理本地7B对照600/2400,修复全部1800个失败且无回归,95%单侧下界99.875%和99.834%;V5臂增加代际日期锚定,中英文指令臂各2400/2400。有限模型穷举331776个语义状态加1990656个查询状态,无全合约反例;10万条轨迹三引擎差分零不一致。

打开论文原文
它要解决什么
记忆系统检索到相关记录后,如何在当前状态下判定这条记录是否具备对外断言资格,避免因冲突、撤销或删除造成错误释放?
研究路径
输入事件经来源绑定写入追加专用的双时态账本,生命周期状态由系统从账本推导,调用方不能赋值。公开投影Vpub过滤掉冲突未解决、已撤销、已删除的记录;证词投影Epub提供仅限证词用途的候选集;排序只在通过投影的候选集上做。释放时以单一校验头处的新鲜视图做精确闭合,五条契约有一条不满足就失败关闭、拒绝输出。
这对工程意味着什么
第一个动作:设计长期代理记忆模块时,先写清楚释放契约(哪些状态可以断言、哪些必须拦截),再接检索排序。要避免的捷径:把检索相关性得分直接当成公开断言资格——混淆这两个判断会让已撤销或冲突的记录被循环引用,而现有检索评测指标根本发现不了。
证据定位
3600用例基准上GPM全匹配完整结果;最优简单策略只匹配1800/3600,且在50%的违规用例上释放不匹配。V3密封服务评测:受治理通道2400/2400,无治理7B对照600/2400,修复全部1800个失败用例且无回归,95%单侧下界99.875%和99.834%;V5臂2400/2400。另有限模型穷举331776个语义状态和1990656个查询状态无全合约反例,10万条轨迹三引擎差分零不一致。(筛选维度:形式化验证、可复核评测、软件工程方法)
适用边界
所有结论都是有界契约与实现结果,不代表开放世界模型精度或世界真值。基准由作者内部设计,尚无外部独立复现报告。服务评测中受治理通道是确定性服务输出,7B对照只提供无治理基线比较,不能据此推断语言模型本身达到完美精度。
方法与英文摘要

GPM把输入事件以来源绑定方式写入追加专用的双时态账本,记录的生命周期状态由系统从账本推导,调用方不能自己指定。公开投影和证词投影在排序之前过滤候选集;释放时用单一校验头处的新鲜视图做精确闭合,不满足契约就失败关闭、拒绝输出。评测分两段:一是GPM-ReleaseBench v1,哈希冻结3600用例,含隐藏反事实用例和三种配套完整策略;二是密封端到端服务评测,含8类查询族、V3/V5两轮封存和中英文指令臂,用无治理的本地7B模型做对照。

Long-term agent memory is usually treated as select--store--retrieve, but retrieval does not decide whether contradictory, superseded, retracted, deleted, or stale records may support an outgoing claim. We introduce Governed Persistent Memory (GPM), an auditable bitemporal state-transition model with source-bound admission, derived lifecycle state, current public barriers, and fail-closed structured release. Five executable clauses cover ledger integrity, source binding, conflict isolation, non-revival after retraction or deletion, and exact claim closure over a fresh view at one verified head. On a prespecified hash-frozen 3,600-case GPM-ReleaseBench, GPM matches all complete outcomes; the strongest of three intentionally simple complete policies matches 1,800/3,600 and makes unmatched releases on 50% of violation cases. A separate sealed end-to-end service evaluation exercises real ingestion and release across eight query families. In its publicly disclosed V3 arm, the governed lane is correct on 2,400/2,400 clusters versus 600/2,400 for ungoverned local Qwen2.5-7B; it repairs all 1,800 baseline failures with no regression (one-sided 95% lower bounds 99.875% and 99.834%). A later V5 reseal over Chinese- and English-command arms, with generation-date pinning and no post-freeze reducer amendment, again obtains 2,400/2,400 per arm. A production-code-independent finite model explores 331,776 semantic and 1,990,656 query states without a full-contract counterexample, and a 100,000-trace three-engine differential yields zero mismatches. These are bounded contract and implementation results, not open-world model accuracy or evidence of world truth. Governed answers in the sealed service evaluation are deterministic service outputs; the 7B result is the ungoverned comparison, not a claim that a language model itself became perfectly accurate.

人机协同与对齐(0 篇)

本轮没有通过深读证据门的重点论文。

本轮分类概览

同一论文只归入一个最先命中的赛道,避免重复计数;“新增候选”只统计首次展示的论文。

赛道新增候选重点
形式化与程序验证00
软件工程与仓库智能01
代码质量与优化00
UI 与 GUI Agent00
个人知识与本体01
人机协同与对齐00

近一个季度监测日历

北京时间。绿色表示有可阅读的新候选,灰蓝表示已监测但无新增,橙色表示部分降级;“无记录”不等于失败。

2026 年 6 月

1无记录2无记录3无记录4无记录5无记录6无记录7无记录8无记录9无记录10无记录11无记录12无记录13无记录14无记录15无记录16无记录17无记录18无记录19无记录20无记录21无记录22无记录23无记录24无记录25无记录26无记录27无记录28无记录29无记录30无记录

近 14 次监测窗口

仅展示公开源的聚合运行状态,不含提示词、全文或个人数据。

本轮新增候选(0 篇)

按赛道、评分和日期展开;中文标签用于导航,英文摘要用于核验。已展示过的旧候选不会每日重复。

形式化与程序验证(0 篇)

本轮该赛道没有候选论文。

软件工程与仓库智能(0 篇)

本轮该赛道没有候选论文。

代码质量与优化(0 篇)

本轮该赛道没有候选论文。

UI 与 GUI Agent(0 篇)

本轮该赛道没有候选论文。

个人知识与本体(0 篇)

本轮该赛道没有候选论文。

人机协同与对齐(0 篇)

本轮该赛道没有候选论文。