Pekerjaan proyek AI mengatakan “kinerjanya lebih kuat”. Yang paling patut dipertanyakan adalah apakah kondisi perbandingannya sudah disejajarkan.
Berikut adalah contoh kasus pengujian yang bersifat asumsi, tidak sesuai dengan proyek saat ini. Proyek A mengklaim memproses satu gambar dalam 2 detik, sedangkan proyek B dalam 1 detik. A menghitung termasuk waktu membaca gambar, antrean, dan keluaran lengkap; A dijalankan di kartu grafis biasa. B hanya menghitung waktu saat model menghasilkan (generate), menggunakan kartu grafis yang lebih kuat dan single request yang sudah dipanaskan (pre-warmed). Angka-angkanya mungkin benar, tetapi belum bisa ditulis bahwa performa B lebih kuat karena yang diukur tidak adalah hal yang sama.
Agar bisa dibandingkan, prasyaratnya: tugas yang dikerjakan, sampel input, perangkat keras, tingkat konkurensi, dan titik awal-akhir pengukuran waktu harus sama. Selain itu, perlu melihat apakah kualitas output memenuhi standar: lebih cepat tetapi menjawab lebih banyak salah, dan hanya melihat kecepatan tidak berarti apa-apa. Jika salah satu komponen kurang, kesimpulannya hanya bisa ditulis: “masing-masing melaporkan skor mereka sendiri, sementara ini belum bisa dibandingkan secara silang (cross-compare)”.
Saat melihat hasil skor baru, cocokkan dengan pihak proyek: gunakan set pengujian yang sama, serta metode pengukuran waktu dan indikator kualitas yang sama. Jika tidak bisa diperoleh, ubah “lebih kuat” menjadi “kondisi belum disejajarkan, menunggu verifikasi”. Jika sejak awal keduanya memang menyelesaikan tugas yang berbeda, maka perbandingan silang juga tidak sah—sebaiknya tanyakan apakah keduanya sama-sama mencapai tujuan yang identik.
Berikut adalah contoh kasus pengujian yang bersifat asumsi, tidak sesuai dengan proyek saat ini. Proyek A mengklaim memproses satu gambar dalam 2 detik, sedangkan proyek B dalam 1 detik. A menghitung termasuk waktu membaca gambar, antrean, dan keluaran lengkap; A dijalankan di kartu grafis biasa. B hanya menghitung waktu saat model menghasilkan (generate), menggunakan kartu grafis yang lebih kuat dan single request yang sudah dipanaskan (pre-warmed). Angka-angkanya mungkin benar, tetapi belum bisa ditulis bahwa performa B lebih kuat karena yang diukur tidak adalah hal yang sama.
Agar bisa dibandingkan, prasyaratnya: tugas yang dikerjakan, sampel input, perangkat keras, tingkat konkurensi, dan titik awal-akhir pengukuran waktu harus sama. Selain itu, perlu melihat apakah kualitas output memenuhi standar: lebih cepat tetapi menjawab lebih banyak salah, dan hanya melihat kecepatan tidak berarti apa-apa. Jika salah satu komponen kurang, kesimpulannya hanya bisa ditulis: “masing-masing melaporkan skor mereka sendiri, sementara ini belum bisa dibandingkan secara silang (cross-compare)”.
Saat melihat hasil skor baru, cocokkan dengan pihak proyek: gunakan set pengujian yang sama, serta metode pengukuran waktu dan indikator kualitas yang sama. Jika tidak bisa diperoleh, ubah “lebih kuat” menjadi “kondisi belum disejajarkan, menunggu verifikasi”. Jika sejak awal keduanya memang menyelesaikan tugas yang berbeda, maka perbandingan silang juga tidak sah—sebaiknya tanyakan apakah keduanya sama-sama mencapai tujuan yang identik.