| On the Efficiency-Safety Dilemma in Large Reasoning Models | | EMNLP 2026 Main(arXiv:2609.23587,2026-09-20) | “attempted but failed”;推理能力损失与维持恶意语义轨迹的能力严格耦合 |
| Self-Cleaning and Captured Anyway: One Measured Primitive for Error in a Store an Agent Writes to Itself, and What a Falling Score Actually Measures | | arXiv:2609.25052(2026-09-06) | 硬上界 (n−1)/n;区间占比 3.6% vs 均匀 20.6%;353/360 方向命中;前沿 capture 0.850;20/20 seed 被捕获 |
| BLINDSPOT: A Benchmark for Safety and Refusal Calibration in Long-Horizon Tool-Using Agents | | arXiv:2609.16305(2026-09-14) | 22 攻击族 / 35 场景 / 7 领域 / 2,500+ 轨迹 / 平均 14.7 轮 / 13 个模型 / 8 项指标;失败多在初始安全步骤之后 |
| BenchShield: Formal Model-Backed Instrumentation for Reward Integrity in LLM-Agent Evaluation Infrastructure | | arXiv:2609.11028(2026-09-10) | 全链召回 23–94% → 77–100%;同向量覆盖 16–56% → 43–78%;单任务成本最多降 65%;运行时检出准确率 96%;456 条人工裁定轨迹,取自 31,000+ 次公开运行 |
| Agora: Git as Shared Memory for Collective AutoResearch | | arXiv:2609.18094(2026-09-16) | 13 个智能体 / 近 12 天 / 1,703 次贡献;3.39 → 1.899 bits per byte;首日 18 条贡献约占 98% 总降幅;165 次独立复现全部成功 |
| BVB: Benchmarking Agentic Video Understanding via Programmatic Reconstruction in Blender | 罗切斯特大学 / 索尼集团 / 卡内基梅隆大学 / 华盛顿大学 | arXiv:2609.15478(2026-09-14) | 288 段真实视频 / 51 种配置 / 10 个模型家族;潜空间相似度 88.6 vs 事实保留率 53.7% |
| When AI Reviews Train AI Reviewers: Scientific-Judgment Collapse and Mitigation(TrustReviewer) | | arXiv:2609.20942(2026-09-17) | 33% 合成污染即让评分标准差 1.63 → 1.44;全合成时同篇评审语义距离 −11%、语料级 −5%;TrustReviewer 推荐完全匹配率 75.40% vs 基线 73.10% |
| VibeCheck: Assessing the Quality of LLM-Generated Unit Tests — A Multi-agent Empirical Study across Heterogeneous Repositories | | POVC '26(ASE 2026 同期工作坊);arXiv:2609.05978 | 五维量表(可运行性 / 断言强度 / 逻辑与边缘覆盖 / 隔离性与确定性 / 可维护性);15 个异构仓库;揭示“可运行 ≠ 行为充分” |