- 资讯公开站rss_arxiv_cs_ai
面向昂贵进化优化的排名可靠教师引导适应度近似:一项TinyML架构搜索研究
Rank-Reliable Teacher-Guided Fitness Approximation for Expensive Evolutionary Optimization: A TinyML Architecture Search Study
arXiv:2609.30553v1 公告类型:新 摘要:昂贵的进化搜索并不总是需要对每个候选个体进行精确的适应度估计。它往往只需要对一个更简单的问题给出可靠答案:哪个候选个体更好?我们通过教师引导学习NSGA-II(TGL-NSGA-II)来满足这一需求,这是一个用于带约束的微型机器学习(TinyML)神经网络架构搜索的低保真框架。一个预训练教师将样本组织为由难度和类别共同定义的分层。随后,每个候选个体都要经过KD-Lite,即在紧凑…
- 论文公开站arXiv
UOPD:多轮智能体同策略蒸馏中的不确定性感知干预
UOPD: Uncertainty-Aware Intervention for On-Policy Distillation of Multi-Turn Agents
同策略蒸馏(OPD)利用教师的密集监督在学生自身轨迹上训练。在多轮环境中,关键决策步骤的错误可能使后续轨迹走向糟糕结果。我们利用教师对学生动作的低置信度进行干预。
- 论文公开站arXiv
面向编程代理的紧凑文档:基准、优化器及为何无法迁移
Compact Documentation for Coding Agents: A Benchmark, an Optimizer, and Why It Does Not Transfer
摘要显示,研究者构建了一个往返基准,用「由描述重新生成的代码能否通过原测试」来评分代码描述质量,发现完整性而非长度决定描述保真度;并据此优化出可泛化到未见文件的描述生成提示。但跨两个模型家族、十个仓库的测试表明,在源码存在时,静态紧凑文档或检索上下文均无法帮助代理解决真实仓库问题,作者将此负面结果连同基准与优化器一并报告。
意义:提示开发者:为编码代理生成文档未必提升真实任务表现,评估代理上下文策略需谨慎,避免无效投入。
- 论文公开站arXiv
学会停止而无需学会停止:自监督置信度训练提升推理效率
Learning to Stop without Learning to Stop: Self-Supervised Confidence Training Improves Reasoning Efficiency
摘要显示,该研究提出一种自监督置信度微调方法:让推理模型在自身推理轨迹的中间点预测对答案的置信度,训练仅用600道题,损失函数不含长度、效率或停止目标,推理时也不做置信度引导或早停。在Gemma、Qwen、Nemotron、GPT-OSS等模型及数学、科学、代码基准上,生成token最多减少25%且准确率持平,效果与显式优化短推理的方法相当,并基本保留原有高层推理结构。
意义:为推理模型提效提供新监督信号:无需改推理流程或加长度惩罚,即可在保持准确率的同时显著降低推理成本。
- 论文公开站arXiv
转导学习的更锐界及其应用
Even Sharper Bounds for Transductive Learning and Its Applications
摘要显示,该论文提出 Sharper Transductive Local Complexity(STLC)方法,用于无放回均匀采样下的转导学习。其构造基于测试-训练经验过程上确界的 Bernstein 型集中不等式,证明使用 swap walk 的修正 log-Sobolev 不等式与双参数熵闭合。通过剥离论证与替代定位泛函,得到与经典归纳局部 Rademacher 复杂度界具有相同不动点与置信项的过量风险界,且去掉了早期转导结果中额…
意义:为转导学习提供更紧的泛化界,去掉对数置信因子,对少样本与核方法场景的理论分析与算法设计有参考价值。
- 资讯公开站Entrepreneur
成功企业家不冒盲目风险:重大决策前的三问框架
Successful Entrepreneurs Don’t Take Blind Risks. Here’s the 3-Question Framework I Use Before Every Big Decision.
摘要显示,该文提出一套用于评估商业风险的决策框架,建议创业者在做出重大决策前通过三个问题审视风险,以降低下行损失并在不确定环境中做出更有信心的领导决策。文章强调成功创业者并非盲目冒险,而是系统化地权衡风险与回报。
意义:为创业者和团队提供可复用的风险决策检查清单,有助于在不确定环境下降低决策失误。
- 论文公开站arXiv
DreamStream:面向端到端驾驶的策略导向生成式仿真
DreamStream: Towards Policy-Oriented Generative Simulation for End-to-End Driving
摘要显示,现有仿真平台存在仿真到真实的视觉差距,会破坏策略感知,难以评估端到端驾驶策略的闭环决策。作者提出 DreamStream,一种基于仿真器接地的自回归视频模型构建的生成式闭环仿真器,通过交通布局引导从大型预训练视频模型蒸馏,在改变视觉外观的同时保留场景布局与动态物体时序一致性等策略相关特征。作者还指出 FID 等感知指标会误判特征保留程度,并提出多表示指标 FDπ。摘要称,在 FDπ 下 DreamStream 相比最强先前闭环…
意义:为端到端自动驾驶提供更贴近策略感知的闭环仿真与评测指标,有望降低真实路测成本并暴露策略失效场景。
- 资讯公开站rss_bbc_business
工党主席称曼联亿万富翁老板在避税后失去道德高地
Billionaire Man United owner loses moral high ground after tax exile, Labour chair says
- 论文公开站arXiv
多跳检索中的可预测失败:分数分布置信评分与弃答
Predictable Failure in Multi-Hop Retrieval: Score-Distributional Confidence Scoring and Abstention
该论文指出多跳检索失败并非均匀分布,而是聚集在结构上可预测的子群体中。作者证明两个结论:置信失败缩减可归约性,以及特征机制互补性。提出 RegimeAbstain 方法,计算检索置信分数(RCS),该分数由最多九个查询-ANN 结构特征的逻辑函数构成,无需额外 LLM 调用,并据此实现校准弃权策略。在三个多跳基准和两种检索架构上评估,RCS 在五种条件下均取得最佳或并列最佳 AUC-AC。
意义:为 RAG 多跳检索提供无需额外 LLM 调用的置信度评分与弃权方案,可降低高置信错误答案率,提升检索系统可靠性。
- 论文公开站arXiv
PosteriorBench:从点估计到后验匹配的生成式逆求解器评估
PosteriorBench: From Point Estimates to Posterior Matching in Evaluating Generative Inverse Solvers
摘要显示,现有生成式逆问题求解器评测多聚焦单次重建是否合理,难以应对病态问题中多解共存的情形。作者提出 PosteriorBench,覆盖 Darcy 流反演、Poisson 源恢复、碳捕集封存与光传输材料推断四类物理逆问题,用拒绝采样与 MCMC 构建高保真参考后验,并配套五项指标:后验均值误差、后验标准差误差、最大均值差异、切片 Wasserstein 距离与径向平均功率谱误差,以评估点精度、边缘不确定性、分布对齐与全局频率保真度,…
意义:为生成式逆问题提供分布级评测,帮助开发者识别模式坍缩与过度自信的不确定性,推动更可靠的科学生成模型评测。
- 资讯公开站Electrek
固态电池制造商Factorial再获重要合作
Solid-state battery maker Factorial secures another big partnership
摘要显示,固态电池专业公司 Factorial Energy 宣布与三井金属(Mitsui Kinzoku)建立合作,后者是少数能够生产硫化物基固态电解质的公司之一。双方合作目标为扩大这一新兴技术的规模化应用。原文未披露合作金额、产能目标或时间表等具体细节。
意义:硫化物电解质是固态电池量产的关键瓶颈,此次合作表明上游材料供应链正加速成型,值得关注固态电池产业化节奏的开发者与投资者留意。
- 论文公开站arXiv
ENCP:用于视觉语言导航的回合归一化共形预测
ENCP: Episode-Normalized Conformal Prediction for Vision-and-Language Navigation
摘要显示,针对视觉语言导航(VLN)智能体需多步序贯决策、标准共形预测在校准中无法为依赖且变长的导航回合提供覆盖保证的问题,作者提出回合归一化共形预测(ENCP):用策略残差置信度重新缩放非一致性分数,并为每个回合校准一个最大分数。在可交换校准与测试回合假设下,该方法以至少 1-α 的概率覆盖每一步真值,同时允许回合内步骤间存在依赖。在 R2R 与 REVERIE 数据集上、四种 VLN 策略与三种非一致性分数下,ENCP 在已见到未见…
意义:为序贯决策智能体提供模型无关的不确定性估计与覆盖保证,可用于判断导航智能体何时应交由更强预测器或人类协助。
- 资讯公开站ScienceDaily Matter & Energy
科学家发现两个超导态伪装成一个
Scientists discover two superconducting states hiding as one
研究人员对二硒化铌(NbSe2)与二硫化钽(TaS2)两种超薄超导体进行高灵敏度测量后发现,它们看似只有单一超导态,实际各自包含两个强相互作用、耦合极紧密的超导态,因而在常规测量中伪装成一个整体。
意义:有助于修正二维超导体的简化物理图像,为量子器件与超导材料设计提供更精细的态结构依据。
- 资讯公开站CNX Software
FREE-WILi 2便携黑客多功能工具:双RP2350、ESP32-C5、ICE40 FPGA与树莓派CM0
FREE-WILi 2 portable hacking multitool features two RP2350 MCUs, ESP32-C5, ICE40 FPGA, and Raspberry Pi CM0
FREE-WILi 2(创始人版)是一款面向硬件黑客、渗透测试人员与嵌入式开发者的开源硬件便携式黑客多功能工具与实验平台。其集成两颗树莓派RP2350微控制器、ESP32-C5无线模块、Lattice ICE40UP5K FPGA以及运行完整Linux的树莓派CM0,并配备3.5英寸电容触摸屏、14键物理按键和模块化Orca扩展接口。无线功能覆盖2.4/5GHz Wi-Fi、蓝牙、LoRa、sub-GHz RF、NFC、125kHz R…
意义:单设备集成双 MCU、FPGA、Linux 与多频段无线,为硬件安全测试与嵌入式原型开发提供一体化便携平台,降低多工具携带成本。
- 资讯公开站Entrepreneur
“抱歉”是邮件中最被滥用的词,正在损害你的可信度
‘Sorry’ Is the Most Overused Word in Your Inbox — and It’s Costing You Credibility
摘要显示,反射性道歉如“抱歉延迟回复”和“温馨提醒”会在职场中悄然削弱你的自信与可信度。文章建议通过更清晰、直接的语言来撰写邮件,以增强沟通效果,避免不必要的歉意表达。
意义:对职场沟通和AI写作工具有启示:减少冗余道歉可提升专业形象,对开发邮件辅助功能的AI有指导意义。
- 论文公开站arXiv
生成评估中FID掩盖的偏差:检测、排序与诊断
What FID Hides: Detecting, Ranking, and Diagnosing Deviations in Generative Evaluation
摘要显示,生成模型常用FID和KID评估,但FID仅基于前两阶矩,可能忽略分布差异,且标量差距未校准采样变异。在ImageNet上,仅优化匹配Inception均值和协方差的不可识别图像,其FID为24.7,而保留的真实图像为58.6。FID和KID为对称标量,无法编码离散度变化方向。为此,引入ZID,结合六个位置和离散敏感指标,输出排序指数、置换p值和符号离散读数,以检测偏差并排序严重性。
意义:为生成模型评估提供更全面的诊断工具,帮助开发者识别模型与真实数据的细微偏差,优化模型调优。
- 论文公开站arXiv
高相干字典下的物理支持置信集
Physical-Support Confidence Sets for Highly Coherent Dictionaries
摘要显示,字典学习后的稀疏追踪在字典高度相干时,可能产生物理解释不明确的原子支持。本文提出分辨率感知的物理支持推断方法,联合考虑字典和部署信号表示的不确定性,通过跨字典置信对应保留兼容解释,并投影到物理支持空间。对于分离尺度为s的局部相干原子类,最小最大物理分辨率满足δ_opt(N,s)≈min{s, 1/(√N s^2)},相对分辨率受方向信息尺度Ns^6控制。计算上引入自适应有限库过程AEB,仅评估影响物理报告的候选,安全粗化或放弃…
意义:该研究为字典学习在高度相干场景下的物理可解释性提供了理论保证和高效算法,对稀疏表示和信号处理领域的开发者具有重要参考价值。
- 论文公开站arXiv
TCP_α:用于可靠音乐信息检索的边际控制置信度估计
$TCP_α$: Margin-Controlled Confidence estimation for reliable Music Information Retrieval
深度神经网络常过度自信,即使预测错误也给出高置信度。后验置信度估计通过训练轻量辅助头解决此问题,但现有目标存在歧义。本文提出TCP_α,一种新置信度目标,通过引入边际控制惩罚来分离正确与错误预测的置信度,并证明其分离边际与类别数无关且随惩罚参数单调增加。研究针对不平衡回归的训练策略,并在拉格识别等任务上验证有效性。
意义:为音乐信息检索等任务提供可靠的置信度估计,有助于开发者构建更可信的AI系统,减少因过度自信导致的错误决策。