- 资讯公开站rss_arxiv_cs_ai
有效的大语言模型微调是否必须依赖人类可读文本?
Is Human-Readable Text Necessary for Effective LLM Fine-Tuning?
arXiv:2609.35868v1 公告类型:新 摘要:有效微调大语言模型是否必须依赖人类可读性?我们研究模型条件化的训练表示能否在无需人类可读文本形式的情况下保持或提升适配效用。我们提出 Desired-Update-Aligned Synthetic Data(DASA),利用冻结参考模型的激活梯度反馈来指导连续合成输入嵌入的优化。受激活梯度在局部风险降低中作用的启发,DASA 针对有用的适配更新,而非源文本重建或语言流畅性。所得…
- 论文公开站arXiv
语言模型的最小侵入式引导
Minimally Invasive Steering of Language Models
论文提出 MISVO(最小侵入式转向向量优化),在冻结语言模型的最终隐藏状态上加入向量以实现测试时奖励适配,并用诱导 token 分布的局部 KL 几何对干预进行惩罚。该 Fisher 二次型可通过与冻结语言模型 head 的矩阵-向量乘积解析求梯度,作者还给出序列级 KL 梯度分解。在约 1B–14B 参数模型的偏好与代码生成任务中,MISVO 在 7 个模型-任务设置中的 6 个取得最高平均奖励,多样性与连贯性接近 Best-of-…
意义:为冻结模型提供无需更新参数、更少损伤生成质量的测试时对齐方法,降低微调成本。
- 论文公开站arXiv
EquivSVA:跨等价 RTL 实现的行为断言形式化验证数据集
EquivSVA: A Formally Verified Dataset of Behavioral Assertions Across Equivalent RTL Implementations
摘要显示,EquivSVA 是一个围绕行为族组织的形式化验证数据集,每个族包含同一外部可观察行为的四个结构不同 RTL 实现、共享接口级金标准属性、三个受控变异体及形式验证证据。数据集涵盖 12 个类别、120 个行为族、480 个参考 RTL 实现、914 个金标准属性和 360 个变异体,每个族均通过固定 17 项验证套件,并提供了族安全的训练、开发与测试划分。
意义:为 LLM 生成 SystemVerilog 断言提供行为级评测基准,可检验断言是否捕捉外部可观察行为而非实现细节,推动形式化验证与代码生成研究。
- 论文公开站arXiv
SWE-Serve:面向生产推理服务的智能体工程基准
SWE-Serve: Benchmarking Agentic Engineering For Production Inference Serving
摘要显示,SWE-Serve 是一个评估智能体完成生产级推理工程任务的基准,包含 53 个源自 SGLang 近期生产变更的仓库级任务,覆盖六大推理工程类别,任务在 CPU 或单张 H100 上执行,采用隐藏功能与回归测试、E2E 服务测试及性能门槛评估。在 11 个模型、31 种配置中,最佳配置平均 pass@1 为 75%,但在 19 个端到端任务中,约三分之一通过局部测试的补丁被服务级 E2E 测试拒绝,暴露出局部完成与生产正确性…
意义:该基准首次系统衡量智能体在生产推理服务中的端到端正确性,揭示局部通过率与真实部署要求之间的落差,为 AI 编码智能体的评估与改进提供更贴近生产的标尺。
- 资讯公开站Semiconductor Engineering
芯片设计中的AI:从代码生成到EDA编排(爱丁堡大学)
AI in Chip Design: From Code Generation to EDA Orchestration (University of Edinburgh)
摘要显示,爱丁堡大学研究人员发表技术展望文章《LLMs in Digital EDA: A perspective on shifting roles from Generation to Orchestration》,提出三个层级角色:单次生成设计产物的Generator、优化输出的Agent等,揭示能力如何累积,并指出角色正从生成向编排转变。
意义:为LLM在芯片设计自动化中的角色演进提供框架,帮助开发者理解从代码生成到流程编排的技术路径。
- 开源项目公开站GitHub
ponytail:让 AI 编程代理像最懒的资深开发者一样思考,能不写代码就不写
DietrichGebert/ponytail — Makes your AI agent think like the laziest senior dev in the room. The best code is the code you never wrote.
摘要显示,GitHub 项目 DietrichGebert/ponytail 的定位是让 AI 代理以「房间里最懒的资深开发者」的方式思考,其核心理念为「最好的代码就是你从未写过的代码」。该条目仅给出项目标语与约 13.9 万星标数,未披露具体实现方式、支持的模型或使用说明。
意义:提出「少写代码」的代理提示思路,对关注 AI 编码代理行为设计与提示工程的开发者有参考价值。
- 开源项目公开站GitHub
OpenHands:AI驱动的开发平台
OpenHands/OpenHands — 🙌 OpenHands: AI-Driven Development
摘要显示,OpenHands是一个AI驱动的开发平台,旨在通过人工智能辅助软件开发和自动化任务。该项目在GitHub上拥有超过8.4万星标,表明其受到开发者社区的广泛关注。该平台可能提供代码生成、调试、自动化等功能,以提升开发效率。
意义:AI驱动的开发工具正成为提升开发者生产力的关键,OpenHands的高星标显示其潜力,可能影响AI辅助编程的未来方向。