Claude Codeのプラグインが「本当に機能しているか」をCI上で自動検証できるように — Anthropicがプラグイン評価コマンドを追加、ベースラインとの差分で効果を数値化
DRANK

9月11日、MarkTechPostが「Anthropic Adds Plugin Evals to Claude Code: 6 Grader Types, a No-Plugin Baseline, and a CI Gate for Skills」と題した記事を公開した。この記事では、AnthropicがClaude Codeにプラグイン評価(Plugin Evals)機能を追加し、6種類のGrader・ベースライン比較・CI連携を実装したことが詳しく紹介されている。

by @tf_official
Related Topics: AI DevOps Continuous Integration