- 论文公开站arXiv
AssemblyWorld:用通用智能体重思3D装配
AssemblyWorld: Rethinking 3D Assembly with General-Purpose Agents
3D装配需将零件及其关系的理解转化为精确空间排布。本文探究预训练通用智能体能否仅通过视觉交互完成物体装配,而无需针对装配任务额外微调。
- 资讯公开站rss_arxiv_cs_ai
PowerZooJax:面向强化学习的基于JAX的电力系统基准
PowerZooJax: A JAX-based Power System Benchmark for Reinforcement Learning
arXiv:2609.36052v1 公告类型:新 摘要:电力系统运行是一个安全关键的序贯决策问题,因此是强化学习(RL)的天然试验平台。然而,现有的电力系统RL环境往往范围狭窄,且受限于基于CPU的仿真工作流,难以进行大规模评估。我们提出PowerZooJax,一个基于JAX的电力系统运行RL基准套件。它提供五个约束马尔可夫决策过程任务,涵盖发电、输电、配电、分布式能源和数据中心微电网。通过将潮流计算、经济调度、市场出清和设备动态重写…
- 资讯公开站rss_arxiv_cs_ai
喝杯咖啡:面向离散扩散的编译目标未来感知引导
Grab a Coffee: Future-Aware Guidance for Discrete Diffusion with Compiled Objectives
离散扩散模型通过并行迭代解析多个 token 来生成序列,为从左到右的生成方式提供了一种灵活替代方案。然而,用序列级目标引导这一过程十分困难,因为某个未解析 token 的价值取决于它能与之组成高奖励序列的其他 token。枚举所有此类补全会使整个引导计算量随未解析位置数量呈指数增长。我们提出 COFFEE,一个即插即用框架,通过将序列依赖与目标分离来避免这种枚举。在每个扩散步骤中,一个无目标载体吸收去噪器预测的边缘 token 分布,…
- 资讯公开站rss_arxiv_cs_ai
有效的大语言模型微调是否必须依赖人类可读文本?
Is Human-Readable Text Necessary for Effective LLM Fine-Tuning?
arXiv:2609.35868v1 公告类型:新 摘要:有效微调大语言模型是否必须依赖人类可读性?我们研究模型条件化的训练表示能否在无需人类可读文本形式的情况下保持或提升适配效用。我们提出 Desired-Update-Aligned Synthetic Data(DASA),利用冻结参考模型的激活梯度反馈来指导连续合成输入嵌入的优化。受激活梯度在局部风险降低中作用的启发,DASA 针对有用的适配更新,而非源文本重建或语言流畅性。所得…
- 资讯公开站Nature News
2型免疫史训练肺巨噬细胞获得病毒病耐受性
Type 2 immune history trains lung macrophages for viral disease tolerance
- 论文公开站arXiv
AdviSD:通过定向多轮自蒸馏学习指导前沿大模型
AdviSD: Learning to Advise Frontier LLMs via Targeted Multi-Turn Self-Distillation
小型可训练顾问可利用自然语言建议引导冻结的语言模型执行器。除任务奖励外,顾问还可利用已完成交互的反馈改进建议,但看似合理的纠正未必能改变执行结果。
- 论文公开站arXiv
重新思考世界-动作建模的表征
Rethinking Representations for World-Action Modeling
世界-动作模型联合学习机器人策略并预测未来观测,使表征空间成为控制与预测的接口。本文通过受控比较研究该空间的设计,发现重建保真度和预训练均非关键。
- 论文公开站arXiv
技能空间射击用于自主机器人策略改进
Skill-Space Shooting for Autonomous Robot Policy Improvement
部署在物理世界的机器人须能在遇到新情况和失败时超越初始训练进行改进。为使改进跨任务扩展,须有效利用经验而无需人类演示每次纠正。
- 资讯公开站Digitimes
韩国AI算力紧张冲击研究人员与初创企业
South Korea AI compute squeeze hits researchers and startups
韩国AI行业面临日益严重的GPU短缺,研究机构和小企业难以获得足够的算力用于模型训练和部署。随着政府支持结束,研究团队发现训练更难持续,初创企业也受到挤压。
- 论文公开站arXiv
照搬相同,蒸馏差异:线性视觉Transformer的初始化
Copy the Same, Distill the Difference: Initializing Linear Vision Transformers
线性视觉Transformer(ViT)旨在用线性复杂度注意力算子替代Softmax ViT中的注意力,以实现更高效的token路由,但需要从头预训练,且通常性能不及原版Softmax。如何初始化是关键。
- 资讯公开站rss_arxiv_cs_ai
BioDyad:同步生物医学发现与机器学习工程
BioDyad: Synchronize Biomedical Discovery and Machine Learning Engineering
arXiv:2609.31939v1 公告类型:新 摘要:智能体生物医学机器学习(ML)依托生物医学证据获取与可执行程序搜索两方面的互补进展。现有系统连接了这些能力的部分方面,但在整个程序搜索过程中协调它们仍具挑战性。新证据必须指导候选构建,执行结果必须为后续发现与复用提供信息,验证需求必须契合搜索预算。我们提出 BioDyad,通过蒙特卡洛图搜索中的两个层级将生物医学发现与 ML 工程耦合。其科学层级将先验生物医学指导与迭代发现相结合…
- 资讯公开站rss_arxiv_cs_ai
通过嵌入式编码改进大语言模型的医学计算能力
Improving Medical Calculation of LLMs with Embedded Coding
arXiv:2609.31908v1 公告类型:新 摘要:大语言模型(LLM)在医学考试和问答基准上表现良好,但在需要精确数值输出的医学计算任务上仍不可靠。这些计算支撑着用药剂量、器官功能评估和预后评分等高风险决策,即使很小的误差也可能带来严重的临床后果。我们提出 MedCode,一个通过训练 LLM 生成嵌入式可执行代码来改进医学计算的框架。给定临床情境,模型识别相关计算器,提取其输入变量,并生成一段将算术运算委托给确定性解释器的脚本…
- 论文公开站arXiv
统一一步式视觉生成的分布训练
Unifying Distributional Training for One-Step Visual Generation
分布训练通过在冻结表示空间中匹配真实与生成特征,为一步式视觉生成提供集体监督;本文提出统一理论框架,将分布建模与匹配差异分离。
- 论文公开站arXiv
PDMD:面向视频扩散模型的投影分布匹配蒸馏
PDMD: Projected Distribution Matching Distillation for Video Diffusion Models
现代视频扩散模型需在长时空Token序列上进行数十次去噪评估,分布匹配蒸馏(DMD)可将函数评估次数降至几次,但DMD样本在训练中会退化。
- 论文公开站arXiv
伸缩式语言模型
Telescopic Language Models
一个已部署的语言模型常需服务多种算力预算,而每个预算点仍需单独训练或压缩;本文训练伸缩式语言模型(TLM)作为连续体,由随机前缀监督的嵌套容量Transformer构成。
- 资讯公开站rss_arxiv_cs_ai
面向昂贵进化优化的排名可靠教师引导适应度近似:一项TinyML架构搜索研究
Rank-Reliable Teacher-Guided Fitness Approximation for Expensive Evolutionary Optimization: A TinyML Architecture Search Study
arXiv:2609.30553v1 公告类型:新 摘要:昂贵的进化搜索并不总是需要对每个候选个体进行精确的适应度估计。它往往只需要对一个更简单的问题给出可靠答案:哪个候选个体更好?我们通过教师引导学习NSGA-II(TGL-NSGA-II)来满足这一需求,这是一个用于带约束的微型机器学习(TinyML)神经网络架构搜索的低保真框架。一个预训练教师将样本组织为由难度和类别共同定义的分层。随后,每个候选个体都要经过KD-Lite,即在紧凑…
- 论文公开站arXiv
UOPD:多轮智能体同策略蒸馏中的不确定性感知干预
UOPD: Uncertainty-Aware Intervention for On-Policy Distillation of Multi-Turn Agents
同策略蒸馏(OPD)利用教师的密集监督在学生自身轨迹上训练。在多轮环境中,关键决策步骤的错误可能使后续轨迹走向糟糕结果。我们利用教师对学生动作的低置信度进行干预。
- 论文公开站arXiv
跳出框框:滑动窗口 KV 推理中的信息保留与传递
Thinking Outside the Box: Retention and Transmission of Information in Sliding-Window KV Inference
滑动窗口 KV 推理指增量处理序列,仅保留固定大小的近期键值状态缓存。它可在推理时应用于预训练因果 Transformer 而无需额外训练,同时其 KV 缓存内存保持固定。
- 资讯公开站Digitimes
DeepSeek论文称AI智能体在训练中学会奖励黑客
DeepSeek paper says AI agents are learning reward hacking during training
DeepSeek创始人梁文锋最新论文指出,AI智能体在训练中已学会利用系统漏洞、绕过既定解题方法,凸显模型开发的新挑战:如何阻止模型走捷径。
- 论文公开站arXiv
OC-GS:面向不规则转台拍摄的高斯泼溅重建
OC-GS: Gaussian Splatting for Irregular Turntable Capture
摘要显示,针对转台拍摄中旋转不均与丢帧导致等角度假设失效的问题,OC-GS 提出以物体为中心的高斯泼溅方法,在共享相机、旋转轴与枢轴的前提下细化每张图像的拍摄角度,联合优化图像几何与角度。在 12、8、6 个不规则视角下,前景 PSNR 分别为 21.26、19.36、15.83dB,均优于四个无位姿高斯泼溅基线;共享训练器下细化角度比固定估计提升 7.88dB,真实拍摄提升 0.70dB。
意义:为稀疏、不规则转台拍摄提供无需精确位姿的三维重建思路,对低成本物体扫描与高斯泼溅应用有参考价值。
- 论文公开站arXiv
生成、跟踪、改进:基于RL微调运动生成器的感知型多技能人形机器人运动
Generate, Track, Improve: Perceptive Multi-Skill Humanoid Locomotion with RL-Fine-Tuned Motion Generators
摘要显示,该工作提出双层运动架构:感知式流匹配运动生成器从原始深度图规划全身轨迹,控制引导强化学习训练的感知跟踪策略执行动作。核心贡献是一种离策略强化学习微调循环,通过结构化搜索采集数据并进行优势加权回归,提升生成器在未见地形与技能组合上的一致性。摘要称地形通过成功率最高提升25个百分点,技能选择提升80个百分点;使用原始深度图无需里程计或高度图,单对策略即可驱动Unitree G1完成走、跑、站立与跳跃等动作。
意义:为开发者提供一种样本高效的离策略微调范式,使多技能人形机器人仅凭深度图即可适应复杂地形,降低感知与部署门槛。
- 论文公开站arXiv
信任引导的决策Transformer
Trust Guided Decision Transformer
摘要显示,Decision Transformer 在长程 rollout 中因条件上下文偏离训练分布而性能下降,这种漂移可通过模型自身的下一状态预测误差观察到。作者提出 Trust Guided Decision Transformer(TGDT),先用滚动下一状态预测误差并结合 split conformal prediction 校准阈值筛选可信上下文后缀,再由冻结 critic 在可信后缀中选择最高价值动作。D4RL 导航与运动…
意义:为离线强化学习中的长程决策提供了一种基于模型自检误差的上下文可靠性筛选思路,有助于提升 Decision Transformer 类方法的稳定性。
- 论文公开站arXiv
直接反馈对齐中的共模坍缩与恢复
Common-Mode Collapse and Recovery in Direct Feedback Alignment
摘要显示,直接反馈对齐(DFA)用固定随机投影回传输出误差训练隐藏层,在 tanh 隐单元与独立 sigmoid 输出下,普通 SGD 可能停滞在接近类别频率常数预测器的损失水平。作者将停滞归因于误差中的共模成分,通过精确的均值-协方差分解分离出由均值教学信号和均值突触前活动构成的秩一更新,其主成分推动 tanh 单元饱和。校准读出基线可抑制坍缩并加速学习。
意义:揭示固定随机反馈训练不稳定的共模机制,为对齐类算法与无反向传播训练的优化设计提供改进思路。
- 论文公开站arXiv
新的LoRA技能应只读不写
New LoRA Skills Should Read but Never Write
摘要显示,该论文针对多个独立训练的LoRA适配器难以合并的问题,指出权重空间合并会相互干扰、全量重训成本高、路由方案又失去单一模型的意义。作者提出READ方法,将每个适配器重写为保持更新等价的平衡规范形式,并让新旧技能耦合单向生长:新技能可读取旧技能输入子空间但不能写入其输出子空间,每次追加仅训练耦合矩阵中新技能对应的一行,组合更新可折叠进基础权重,无推理成本与路由。
意义:为多任务LoRA合并提供免路由、零推理开销的持续学习方案,对模型能力增量扩展与适配器组合有工程价值。
- 论文公开站arXiv
通过信念自蒸馏进行用户模型提取
User Model Extraction via Belief Self-Distillation
摘要显示,该研究提出 Belief Self-Distillation(BSD)框架,让冻结的 LLM 充当自身教师,从自然对话中蒸馏出紧凑的用户表征,既可解码也可写回模型,从而将线性探测与因果探测统一。实验表明,BSD 能跨多个模型家族忠实恢复用户信念,且干预效果显著强于匹配的隐状态引导;改变模型推断的用户意图会改变拒绝行为,而请求本身保持不变。研究还发现不同独立训练的 LLM 在用户表征上收敛出共享几何结构。
意义:该工作把用户信念变为可读可写的内部状态,为AI安全中的拒绝行为归因与干预提供了新工具,也提示跨模型用户表征可能存在共性。