Benchmark LLM untuk Coding: Akurasi Sudah Sama, Kunci Ada di Kecepatan dan Biaya per Bahasa
Benchmark mandiri menguji tiga LLM pada 14 soal coding (Python, C#, Bash) mengungkap akurasi sudah setara 100% pass@3. Perbedaan nyata ada di biaya (1,3x) dan latensi (6,6x), dengan satu model sangat lambat pada Bash (90-168 detik) meskipun cepat di Python dan C#. Kesimpulan: pilih model berdasarkan kecepatan dan biaya per bahasa, bukan skor agregat.