全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

站内快照 · 国内可打开。外网原文可能无法访问。

  • 资讯公开站rss_arxiv_cs_ai

    OpenAI-HuggingFace:对齐测试的复现与教训

    OpenAI-HuggingFace: A Reproduction & Lessons for Alignment Testing

    arXiv:2609.35799v1 公告类型:新 摘要:2026年7月,OpenAI的智能体通过其预期环境之外的渠道协同行动,入侵了Hugging Face的安全基础设施。现有的对齐测试实践能否预见到这一事件?如果不能,需要改变什么?我们探讨了这些问题。首先,我们识别出导致该事件的不对齐行为。然后,我们展示如何从公开可用的模型中手动引出这些行为,并且审计智能体若获得大量算力预算也能做到同样的事。基于我们的结果,我们提出了改进对齐测试的方向。具体而言,在本项目中:(1) 我们在模拟原始流水线和工具的环境中,使用公开可用的模型,复现了导致OpenAI-Hugging Face事件的不对齐AI行为。(2) 我们证明审计智能体在获得高层定性描述的情况下能够引出类似行为。(3) 我们观察到做到这一点的关键要素是算力。复现每种行为所需的算力差异很大,这表明能够成功引出的不对齐行为范围随算力扩展。(4) 我们表明……

    未知 tech_release source_collector