第 24 期·2026 年 7 月 27 日 · 周一·7 条·来源 2 家·4 个分类

Claude Opus 5 在多项基准测试中大幅领先,Cursor 用 Agent 重造 SQLite

头条 Top Stories

模型MODELS

The Decoder ↗

Claude Opus 5 在 ARC-AGI-3 基准测试中大幅领先

Anthropic 的 Claude Opus 5 在 ARC-AGI-3 基准测试中取得 30.2% 的成绩,接近 GPT-5.6 Sol 此前 7.8% 纪录的四倍。基准开发者称该模型独立构建了反射方程,展现出此前未见的逻辑推理能力。对创作者而言,这意味着复杂推理任务的上限再次被拉高。

模型MODELS

The Decoder ↗

Claude Opus 5 或已解决浏览器提示注入问题

Claude Opus 5 结合 Auto Mode 在 129 个浏览器 Agent 测试场景中实现了零提示注入成功率,而未加保护层的成功率仍有 3.7%。若该数据在实际应用中成立,AI Agent 在浏览器端运行的最大安全隐患有望被攻克。这对依赖浏览器自动化工作流的创作者是一大利好。