- 论文公开站arXiv
CLIFT: Conformal Self-Verification for Web Agent Training and Test-Time Scaling
Open-source web agents are now strong enough to execute realistic browser tasks, but training them with reinforcement learning still depends on weak supervision: binary task success is too sparse for credit assignment, w…
- 论文公开站arXiv
Trust the Direction, Search the Step: Zero-and-First-Order Methods for LLM Fine-Tuning
Step-size selection remains a central challenge in large-scale neural network optimization; conservative steps slow convergence, while aggressive steps can destabilize it. We combine \textbf{Z}ero-and-\textbf{F}irst-\tex…
- 论文公开站arXiv
Compression Footprints as Security Signals for Model-Poisoning Defense in Federated Learning
Lossy compression is widely used in Federated Learning (FL) but is generally treated as an error source, while conventional poisoning defenses inspect update geometry. In this work, we instead treat the compressor's resp…
- 论文公开站arXiv
Kafila:在可信异构消费级机器集合上服务大语言模型
Kafila: Serving Large Language Models on a Trusted Set of Heterogeneous Commodity Machines
研究组成员或朋友圈各自拥有几台消费级计算机,但单台都不足以运行一个有能力的大语言模型。现有系统在开放集群中汇聚此类算力,而仅接纳可信机器的群体则无法使用。
- 论文公开站arXiv
信任引导的决策Transformer
Trust Guided Decision Transformer
摘要显示,Decision Transformer 在长程 rollout 中因条件上下文偏离训练分布而性能下降,这种漂移可通过模型自身的下一状态预测误差观察到。作者提出 Trust Guided Decision Transformer(TGDT),先用滚动下一状态预测误差并结合 split conformal prediction 校准阈值筛选可信上下文后缀,再由冻结 critic 在可信后缀中选择最高价值动作。D4RL 导航与运动…
意义:为离线强化学习中的长程决策提供了一种基于模型自检误差的上下文可靠性筛选思路,有助于提升 Decision Transformer 类方法的稳定性。
- 论文公开站arXiv
信还是不信:语音中的检索增强事实核查
To Trust or Not to Trust: Retrieval-Augmented Fact Checking in Speech
摘要显示,研究者提出 VeriSpeak,一个用于研究大型音频语言模型(LALM)语音事实核查能力的探针基准,包含 3,879 条口语化声明,覆盖时间、地理与关系类事实,真假标签均衡。实验发现文本与语音之间存在稳定的模态差距:能可靠核查书面声明的模型在同样内容以语音呈现时常常失败;仅靠检索收益有限,因为模型常将检索证据与语音声明混淆,而检索结合显式推理可提升声明-证据比对效果,思维调优的 LALM 达到 86.1% 准确率。
意义:提示开发者:语音场景下事实核查不能简单复用文本能力,需重视跨模态差距与检索证据的显式推理比对。
- 论文公开站arXiv
可用护栏:跨ML系统认证选择性预测
Available Guardrails: Certifying Selective Prediction across ML Systems
摘要显示,该论文将选择性预测器视为安全门,要求在每个报告单元上以目标精度认证可靠性。作者用经典精确二项式反演使“可用性”可计算,并将固定组序下的报告分区选择建模为动态规划,揭示安全、粒度与覆盖流量之间的权衡。结果显示,真实信息规划者比支持平衡平均覆盖率提升0.157,而朴素估计器仅恢复0.005;跨规划/选择分割可部分弥补差距,提升0.060,方向在60个模型效应中59个复现。
意义:为需要按工具、策略标签或患者亚组认证精度的ML部署提供可计算框架,提示有限校准数据下认证可用性是核心瓶颈。
- 论文公开站arXiv
智能体社会需要社会性治理框架
Agentic Societies Need a Social Harness
摘要显示,论文提出"智能体社会"概念,指多个AI智能体代表不同主体、跨信任边界自主协作。实验表明,即便诚实且能力足够的智能体,在现有 harness 与消息原语下也常无法达成满意结果;而故障或恶意智能体可通过通信("speech")漏洞拖延协作、影响结果并追求有害目标。作者主张除管理私有上下文与委托人通信的"个人 harness"外,还需"社会性 harness",并提出分层架构,实现失败预防、运行时无效消息检测与事后追责。
意义:为多智能体系统提供跨信任边界的通信安全与追责设计思路,对构建可审计、抗攻击的智能体协作基础设施有直接参考价值。