AIプロジェクトは「性能がより高い」と言うが、最も確認すべきなのは比較条件が揃っているかどうかだ。
以下は仮の評価事例であり、現行プロジェクトに対応していない。プロジェクトAは、画像1枚の処理に2秒かかると主張し、プロジェクトBは1秒だという。Aは画像の読み取り、キューイング、完全な出力までをすべて含めており、普通のGPUで実行している。一方Bはモデル生成時間だけを計測しており、より強力なGPUと、予熱済みの単発リクエストを使っている。数字が本当だとしても、Bのほうが「性能がより高い」とはまだ書けない。というのも、両者で測っているのが同じことではないからだ。
比較可能な前提は、タスク、入力サンプル、ハードウェア、同時実行数、計時の開始・終了ポイントが一致していることだ。さらに、出力品質が基準を満たしているかも見る必要がある。速いが間違いがより多いのであれば、速度だけを見ても意味がない。どれかが欠けていれば、結論は「各自がそれぞれ成績を報告しており、現時点では横並び比較ができない」という形にしかできない。
新しいスコアが出てきたら、プロジェクト側に同一のテストセット、同一の計時の考え方、そして品質指標を照合する。入手できない場合は、「より強い」を「条件が揃っていないため、検証待ち」に置き換えるべきだ。もしそもそも両者が別々のタスクを完了しているのなら、横並び比較自体が成立しない。その場合は、それぞれが同じ目標を達成しているかを確認して聞くべきだ。
以下は仮の評価事例であり、現行プロジェクトに対応していない。プロジェクトAは、画像1枚の処理に2秒かかると主張し、プロジェクトBは1秒だという。Aは画像の読み取り、キューイング、完全な出力までをすべて含めており、普通のGPUで実行している。一方Bはモデル生成時間だけを計測しており、より強力なGPUと、予熱済みの単発リクエストを使っている。数字が本当だとしても、Bのほうが「性能がより高い」とはまだ書けない。というのも、両者で測っているのが同じことではないからだ。
比較可能な前提は、タスク、入力サンプル、ハードウェア、同時実行数、計時の開始・終了ポイントが一致していることだ。さらに、出力品質が基準を満たしているかも見る必要がある。速いが間違いがより多いのであれば、速度だけを見ても意味がない。どれかが欠けていれば、結論は「各自がそれぞれ成績を報告しており、現時点では横並び比較ができない」という形にしかできない。
新しいスコアが出てきたら、プロジェクト側に同一のテストセット、同一の計時の考え方、そして品質指標を照合する。入手できない場合は、「より強い」を「条件が揃っていないため、検証待ち」に置き換えるべきだ。もしそもそも両者が別々のタスクを完了しているのなら、横並び比較自体が成立しない。その場合は、それぞれが同じ目標を達成しているかを確認して聞くべきだ。