全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「VR」共 3 条

  • 论文公开站arXiv

    半事实信用增强策略优化

    Semifactual Credit-Augmented Policy Optimization

    可验证奖励强化学习(RLVR)提升了 LLM 推理能力,但其预测仍对任务无关的提示特征敏感。本文通过半事实提示干预研究这种敏感性。

  • 论文公开站arXiv

    DexRoam:从第一人称全身人类演示学习移动双臂灵巧操作

    DexRoam: Learning Mobile Bimanual Dexterous Manipulation from Egocentric Whole-Body Human Demonstrations

    移动双臂灵巧操作需在单条轨迹中协调运动、全身动作与手指级灵巧性,造成严重的机器人演示瓶颈;第一人称人类演示提供了可扩展的替代方案。

  • 论文公开站arXiv

    通过局部增强偏好与表示解缠改进跨问题车辆路径规划

    Improving Cross-Problem Vehicle Routing with Locally Augmented Preferences and Representation Disentanglement

    摘要显示,多任务车辆路径问题求解器面临训练监督弱和架构纠缠的挑战。为此,提出POLAR训练算法,通过局部搜索细化最佳解码路径以形成更优偏好对,以及PLE编码器,利用门控机制分离共享专家与任务特定专家,逐步解缠通用路由结构与约束特定编码。实验表明,两者结合可提升当前最先进性能。

    意义:对开发者而言,该研究提供了训练算法与架构设计的改进,有望提升多任务VRP模型的泛化能力与训练效率,推动实际物流调度应用。