- 资讯公开站rss_arxiv_cs_ai
SkillScriptBench: Benchmarking Self-Evolution of Executable Agent Skill Packages Beyond Markdown
arXiv:2610.04008v1 Announce Type: new Abstract: Executable Agent Skills combine natural-language instructions and scripts into reusable packages for LLM agents, and revising them requires fixing errors without breaking …
- 资讯公开站rss_arxiv_cs_ai
FlashSinkhorn 2: Block-Sparse Entropic Optimal Transport
arXiv:2610.02395v1 Announce Type: new Abstract: Streaming GPU solvers for entropic optimal transport (EOT), such as FlashSinkhorn, avoid storing the dense kernel but still evaluate all $n\times m$ point pairs in every S…
- 资讯公开站rss_arxiv_cs_ai
K-Dense BYOK: An Open-Source AI Research Assistant That Runs Locally and Keeps a Hash-Chained Lab Notebook
arXiv:2610.00074v1 Announce Type: new Abstract: K-Dense BYOK (bring your own keys) is a free, open-source AI research assistant for scientists in any field that runs on the researcher's own computer. The researcher supp…
- 资讯公开站rss_arxiv_cs_ai
PowerZooJax:面向强化学习的基于JAX的电力系统基准
PowerZooJax: A JAX-based Power System Benchmark for Reinforcement Learning
arXiv:2609.36052v1 公告类型:新 摘要:电力系统运行是一个安全关键的序贯决策问题,因此是强化学习(RL)的天然试验平台。然而,现有的电力系统RL环境往往范围狭窄,且受限于基于CPU的仿真工作流,难以进行大规模评估。我们提出PowerZooJax,一个基于JAX的电力系统运行RL基准套件。它提供五个约束马尔可夫决策过程任务,涵盖发电、输电、配电、分布式能源和数据中心微电网。通过将潮流计算、经济调度、市场出清和设备动态重写…
- 资讯公开站rss_arxiv_cs_ai
ConflictVLA-Bench:评估视觉-语言-动作模型对前提冲突的行为反应
ConflictVLA-Bench: Benchmarking Behavioral Responses of Vision-Language-Action Models to Premise Conflicts
arXiv:2609.31792v1 公告类型:新 摘要:视觉-语言-动作(VLA)模型在操作任务上表现强劲,但其对无效任务前提的反应仍未被充分探索。现有对前提冲突的评估往往聚焦于最终任务结果,然而仅凭任务失败无法区分行为脱离与继续追求随后出现执行错误。我们将后一种模式称为“失败坚持”(Failed Persistence)。为研究这一现象,我们提出 ConflictVLA-Bench,它将冲突 rollout 与前提一致的参考 rol…
- 资讯公开站CNX Software
MemBrowse持续跟踪固件内存占用,对开源项目免费
MemBrowse continuously tracks firmware memory footprint, is free for open-source projects
摘要显示,MemBrowse 是一款面向嵌入式开发者的固件内存追踪工具,可在持续集成中监控 RAM 与 Flash 占用,支持 GitHub Actions、GitLab CI/CD、Jenkins 等 CI 系统。每次向主分支提交代码后自动记录内存变化,避免固件体积超出 Flash 或 RAM 不足时才被发现,并提供完整历史曲线展示内存使用趋势与剩余空间。该工具对开源项目免费。
意义:嵌入式固件内存溢出常在上线前才暴露,该工具把内存占用纳入 CI 门禁,降低发布风险,对嵌入式与边缘 AI 开发者有实用价值。
- 资讯公开站Ars Technica
研究人员利用Claude入侵OpenAI
Researchers used Claude to hack OpenAI
摘要显示,研究人员借助 Anthropic 的 Claude 模型成功接触到一名 OpenAI 员工账户及敏感的 GitHub 数据。报道未披露攻击的具体技术路径、时间线或 OpenAI 的官方回应,因此该事件的性质(安全研究演示还是真实入侵)尚不明确。
意义:若属实,说明前沿模型可被用于辅助针对 AI 公司自身基础设施的攻击,凸显模型滥用防护与内部权限管理的紧迫性。