NUNUapakah ini dibuat AI?

Metodologi tolok ukur

Bekukan dulu.
Ukur kemudian.

Ambang batas evaluasi ditetapkan sebelum label uji yang belum tersentuh dilihat. Kelompok sumber dan generator dijaga tetap terpisah sejauh datasetnya memungkinkan.

Buka pemeriksa gratis

Cakupan dulu, baru skor.

Setiap hasil adalah sinyal peringatan. Bukti dan batasan di bawah ini menentukan apa yang bisa dan tidak bisa didukung oleh jalur ini.

Gerbang utama

Laporkan akurasi, akurasi berimbang, tingkat tangkapan pada konten sintetis, tingkat peringatan palsu pada konten asli, cakupan, dan penolakan menilai.

Tanpa akurasi pilih-pilih

Kasus tidak tahu dan mungkin tetap terlihat; keduanya tidak dihapus diam-diam demi memperindah angka utama.

Keterulangan

Catat versi model, checksum artefak, prapemrosesan, jumlah sampel, pembagian data, dan tanggal evaluasi.

Jangan menyimpulkan lebih dari yang diukur jalur ini.

  • Set internal yang serba praktis bukanlah validasi independen.
  • Ambang batas yang dipilih setelah melihat label uji hanya bersifat penjajakan.
  • Satu angka gabungan tidak bisa menggantikan irisan kegagalan per generator, format, dan kelompok demografis.

Lanjutkan dengan bukti

Tabel tolok ukur yang diterbitkanBaca selengkapnya →Peringatan palsuBaca selengkapnya →Pusat kepercayaanBaca selengkapnya →