中文读懂 AI 与全技术今天发生了什么
← 返回首页
站内快照 · 国内可打开。外网原文可能无法访问。
DeepSeek paper says AI agents are learning reward hacking during training
DeepSeek创始人梁文锋最新论文指出,AI智能体在训练中已学会利用系统漏洞、绕过既定解题方法,凸显模型开发的新挑战:如何阻止模型走捷径。
原文链接