- 论文公开站arXiv
基于 LLM 的代码漏洞修复中的指标失效:实证研究与变更感知筛选
Metrics Failure in LLM-Based Code Vulnerability Repair: An Empirical Study and a Change-Aware Screen
摘要显示,作者通过五项对照实验(203个Big-Vul漏洞函数、三个开源代码LLM、三种提示策略)论证编译率在单函数漏洞修复评估中不可靠:约64%的编译失败与模型无关,同一补丁在单个编译器标准标志下编译率波动1.8至2.7倍,且与参考相似度指标给出的模型排序相反;作为优化目标还会奖励删除与占位符式非修复。整函数CodeBLEU同样失效,连未修改的漏洞输入也得分高于所有模型。作者另考察仅对编辑区域打分的diff_F1变更感知筛选方法。
意义:提醒开发者与研究者:以编译率或整函数相似度衡量LLM漏洞修复会得出误导性结论,评估应关注实际修改区域。
- 论文公开站arXiv
生成评估中FID掩盖的偏差:检测、排序与诊断
What FID Hides: Detecting, Ranking, and Diagnosing Deviations in Generative Evaluation
摘要显示,生成模型常用FID和KID评估,但FID仅基于前两阶矩,可能忽略分布差异,且标量差距未校准采样变异。在ImageNet上,仅优化匹配Inception均值和协方差的不可识别图像,其FID为24.7,而保留的真实图像为58.6。FID和KID为对称标量,无法编码离散度变化方向。为此,引入ZID,结合六个位置和离散敏感指标,输出排序指数、置换p值和符号离散读数,以检测偏差并排序严重性。
意义:为生成模型评估提供更全面的诊断工具,帮助开发者识别模型与真实数据的细微偏差,优化模型调优。
- 论文公开站arXiv
序列预测中的真实校准度量研究
Truthful Calibration Measures for Sequential Prediction
校准要求概率报告有条件的无偏且可解释为概率。校准度量衡量误校准报告的数值误差。Haghtalab等人(2024)提出了一种近似真实的在线预测校准度量,但精确真实性是否与完备性和可靠性兼容仍是开放问题。本研究否定性地解决了该问题:在序列二元预测中,即使结果独立,精确真实性与完备性和可靠性不可兼得。随后研究表明该不可能性仅针对精确真实性。作者给出两种从基础校准度量出发的通用归约,分别产生加性和乘性近似真实的校准度量。应用乘性归约,对每个0<…
意义:为在线预测和概率校准提供理论指导,明确精确真实性的局限,并给出改进的近似真实度量构造方法,对算法设计和评估指标有参考价值。