AI開発・評価

AIコードレビューは「指摘の数」で選ばない。GitHub ReviewBenchが示す評価の軸

株式会社本質 · · 約5分

AIコードレビュー、指摘の数で選ばない。GitHub ReviewBenchを題材にした青と紺のサムネイル

AIにコードレビューを任せたら、コメントが増えた。それだけで、開発は楽になったと言えるでしょうか。

指摘が正しいかを調べ、今回は直さない理由を書き、やり取りを閉じる。その時間まで増えてしまうと、レビューを速くするための道具が新しい仕事を生みます。一方、コメントが少なくても、見逃した不具合が重大なら困ります。

2026年10月5日にGitHubが研究プレビューとして公開した「ReviewBench」は、この悩みに向き合うための評価基盤です。AIレビューの導入を考える開発責任者にとって、ランキングの順位以上に、評価の分け方が参考になります。

219件の変更で、何を拾い、何を見逃したかを見る

ReviewBenchは、コードの変更提案であるプルリクエスト(PR)を使い、AIのレビュー能力を比べます。公式発表によると、対象は19言語にまたがる219件の公開PRです。「1億件超」という数字も発表に登場しますが、これはPRの分布を調べた母集団であり、実際の評価件数ではありません。

人のレビューや解析ツール、複数のAIなどから集めた指摘を基準に、既知の問題をどれだけ拾えたか、指摘にどれだけ有用なものが含まれるかを見ます。重大度や問題の種類で分けて比較できるのも特徴です。GitHubの公式発表

本質が注目するのは、「よく指摘するAI」と「任せたいAI」を分けて考えられることです。障害につながる不具合を拾いたいチームと、保守しやすいコードに整えたいチームでは、助かるコメントも違います。

「正解率」の分母を確かめる

数字を読むときに、一つ気をつけたい点があります。

方法論でいう grounded recall は、あらかじめ有用だと判定された問題のうち、どれだけ見つけたかです。一方、grounded precision は、基準の指摘と対応づけられたものだけで計算します。AIが出した全コメントの有用さを表す数字ではありません。

基準にない新しい指摘も判定に加えるのが augmented precision です。不要なコメントの負担を考えるなら、こちらも確認したい指標です。ただし、判定自体にAIを使うため誤りは残ります。また、augmented recallは新しい発見に応じて分母が変わるので、その値だけで別のAIを順位づけするのは避けるべきです。公式の評価方法

ベンチマークの「高得点」を見たら、何を数え、何を数えていないのかまで確認する。その一手間が、期待と実際のずれを小さくします。

自社で試すなら、直さなかった指摘も残す

ここからは、本質の提案です。

たとえば、受注システムの金額計算を変更するPRを考えます。変数名への提案を何件も出すAIと、特定条件で合計金額がずれる不具合を一件見つけるAI。コメント件数では前者が多くても、この変更で先に必要なのは後者でしょう。これは評価の考え方を示す仮の例です。

導入前には、自社で扱う変更をいくつか選び、候補のAIに同じ変更をレビューさせます。比較中は変更内容と設定を固定し、人が正誤と重大度を確認する。記録しておきたいのは、次の項目です。

  • 見つけてほしかった重大な問題を拾えたか。見逃したものは何か。
  • 採用しなかった指摘の確認に、何分かかったか。不要と判断した理由は何か。
  • AIの応答時間に加え、人の確認や修正を含め、レビュー完了までどれだけかかったか。
  • そのPRを処理するための推論費はいくらか。

全部を一つの点数に丸める必要はありません。重大な見落としを許容しない仕事では、それを最初の条件にする。その条件を満たす候補の中で、確認の手間や費用を比べるほうが判断しやすいはずです。

そして、AIの指摘を採用した件数だけを成果にしないこと。不要な提案まで直せば、修正件数は増えます。直さなかった理由にも、道具を選ぶための情報があります。

公開ベンチマークは、候補を絞る入口に

公式リポジトリでは、評価対象と基準となる指摘を公開しています。25件の小さな試行用セットもありますが、それだけで品質の順位を決める用途ではありません。自分のレビューエージェントを評価する場合、試行・調整の推論費は自己負担です。最終提出で運営が負担するのは判定側の費用で、レビュー側の推論費まで無料になるわけではありません。公式README

公開PRでの成績は、自社の業務ルールまで理解できる保証ではありません。受注金額の端数処理や、変更してはいけない締め後のデータなど、社内の前提がなければ見抜けない問題もあります。

ReviewBenchで候補を絞り、最後は自社の変更とレビューの手間で確かめる。AIを導入したかどうかより、安心して変更を出せるまでの仕事が減ったかを見たいと、本質は考えています。

本質では、AIを組み込む業務の整理から実装・改善まで支援しています。レビュー支援を含め、どの判断をAIに任せ、どこを人が確認するかを整理したい方は、AI・システム開発の支援内容をご覧ください。

本記事は2026年10月6日時点の公式資料に基づく解説と本質の考察です。当社でReviewBenchを実行した検証報告ではありません。