资讯

Anthropic Adds Plugin Evals to Claude Code: 6 Grader Types, a No-Plugin Baseline, and a CI Gate for Skills

marktechpost.com·2026/9/11 21:05:55🔗 原文

📋总体概括

Anthropic为Claude Code发布了新的插件评估工作流,通过claude plugin eval命令让插件在真实提示词下运行,自动评判Claude的输出结果,并与不加载插件的基线运行进行对比。该机制回答了插件开发者此前无法量化的问题:技能是否被触发、输出质量是否有实质提升。方案包含6种评分器类型和可作为CI门禁的自动化检查,标志着Claude Code插件生态开始走向工程化、可测量的质量管理体系。

关键信息

  • Anthropic为Claude Code推出plugin evals工作流,核心命令为claude plugin eval
  • 评估机制会将插件运行结果与不加载插件的基线运行对比,量化插件实际贡献
  • 提供6种评分器类型,可自动评判Claude产出质量
  • 评估回答三个关键问题:技能是否触发、输出是否更好等此前无法测量的指标
  • 评估可集成到CI流程中作为技能发布的质量门禁

🔥犀利点评

这步棋比表面看的重要得多。插件生态的死穴从来不是能力,而是不可验证——开发者根本不知道自己的skill有没有被触发、是不是在帮倒忙。Anthropic把no-plugin基线对比和CI门禁做成官方工作流,等于把插件开发从玄学拉进软件工程,这会让认真做插件的团队和糊弄的人迅速拉开差距。生态成熟的标志就是质量可以度量,Claude Code正在补上这一课。

本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文