- 论文公开站arXiv
LLM何时应弃答?用于选择性风险控制的自问链
When Should LLMs Abstain? Chain-of-Self-Questioning for Selective Risk Control
摘要显示,论文提出仅靠提示词的 Chain-of-Self-Questioning(CoSQ)框架,让模型在明确评估回答问题所需信息后再决定是否作答。在 TruthfulQA 817 题多选题验证集上,用 11 个开源与托管模型家族测试 17 种条件:平衡选项协议下 Grounded-CoSQ(τ=0.90)将平均无条件错误作答率从思维链提示的 13.1% 降至 8.9%,相对下降 32.1%,作答准确率由 86.9% 升至 89.7%…
意义:为开发者提供无需训练、可调阈值的拒答机制,在高风险场景中以可控覆盖率降低无依据作答风险。
- 开源项目公开站GitHub
ponytail:让 AI 编程代理像最懒的资深开发者一样思考,能不写代码就不写
DietrichGebert/ponytail — Makes your AI agent think like the laziest senior dev in the room. The best code is the code you never wrote.
摘要显示,GitHub 项目 DietrichGebert/ponytail 的定位是让 AI 代理以「房间里最懒的资深开发者」的方式思考,其核心理念为「最好的代码就是你从未写过的代码」。该条目仅给出项目标语与约 13.9 万星标数,未披露具体实现方式、支持的模型或使用说明。
意义:提出「少写代码」的代理提示思路,对关注 AI 编码代理行为设计与提示工程的开发者有参考价值。