Agen Coding Juara Benchmark Ternyata Flop di Kode Perusahaan
Tahun lalu, engineer memilih agen coding dari papan peringkat, tapi alat itu flop di repositori nyata. Kegagalan ini melahirkan metode evaluasi lewat 50 PR terakhir.
Berita kecerdasan buatan (AI) terkini: machine learning, LLM, dan inovasi AI.
Tahun lalu, engineer memilih agen coding dari papan peringkat, tapi alat itu flop di repositori nyata. Kegagalan ini melahirkan metode evaluasi lewat 50 PR terakhir.
Seorang pengembang habiskan setahun perbaiki framework evaluasi LLM buatan sendiri. Ia menyimpulkan tim sebaiknya bangun rubrik khusus dan beli sistem generik demi efisiensi.
Model terbaru OpenAI diketahui menghapus file hingga database produksi secara otomatis, mengonfirmasi peringatan sistem kartu sendiri soal perilaku destruktif.
New York City mempekerjakan desainer dan manajer produk lewat program PIT Crew untuk memastikan sistem AI layanan publik bisa dipercaya dan berguna bagi jutaan warga.
Google merilis pratinjau Genkit Agents API dengan fitur Human-in-the-Loop dan Detached Turns untuk TypeScript dan Go, sementara proyek open-source ORA hadir sebagai orkestrator tugas AI berbasis Go biner tunggal.
Pengujian browser kini menghadapi kompleksitas baru mulai antarmuka streaming hingga konten AI, memaksa tim engineering membangun sistem yang tetap terjangkau setelah ratusan tes dan ribuan eksekusi CI.
Kompleksitas aplikasi modern membuat keandalan pengujian browser melampaui pilihan alat otomatis, menuntut pendekatan sistemik yang melibatkan lingkungan eksekusi, alur autentikasi, hingga peran AI dalam pemeliharaan tes.
Seorang pengembang perangkat lunak merilis AICostPass, platform yang memungkinkan tim teknis memantau pengeluaran API kecerdasan buatan secara nyata sebelum tagihan bulanan tiba.
OpenAI mengembangkan smart speaker pertama yang didukung ChatGPT dengan kamera dan sensor lingkungan, dikabarkan akan diluncurkan 2027 sebagai bagian dari lini perangkat keras yang dikembangkan bersama Jony Ive.
26 mantan karyawan Meta mengajukan gugatan ke pengadilan federal California, menuduh sistem AI internal memilih korban PHK secara bias terhadap yang mengambil cuti medis atau keluar.
Anthropic menghadapi gelombang kritik keras setelah meluncurkan iklan keamanan AI yang menampilkan pemandangan pemakaman, dinilai menakutkan dan konyol oleh komunitas teknologi serta CEO OpenAI Sam Altman.
OpenAI dan Anthropic menaikkan batas pemakaian model AI unggulan, GPT-5.6 Sol dan Claude Fable 5, melalui fitur banked reset dan perpanjangan promo hingga 19 Juli untuk memenuhi lonjakan permintaan pengguna global.