Anthropic baru saja merilis Claude Fable 5.1 yang diklaim sebagai model tercanggih untuk pemrograman dan pekerjaan berbasis pengetahuan, namun pengujian di dunia nyata memperlihatkan hasil yang tidak jauh berbeda dari pendahulunya.
Menurut pengamatan Kabayan News, peluncuran model baru ini sempat memicu antusiasme tinggi di kalangan industri teknologi berkat lonjakan skor pada benchmark Terminal-Bench-Science, di mana versi 5.1 mencetak angka 52,6 persen dibandingkan Fable 5 yang hanya meraih 24,7 persen.
Sebagaimana dilaporkan oleh analisis Kabayan News, pengujian independen yang dilakukan pada empat skenario tugas nyata justru menunjukkan bahwa kedua versi tersebut memiliki tingkat akurasi yang setara tanpa perbedaan signifikan.
Related Stories
Suka dengan Artikel Ini?
Dapatkan lebih banyak cerita menarik dengan berlangganan newsletter kami. Gratis!
SubscribeBerdasarkan pengujian teknis, baik Fable 5 maupun Fable 5.1 sama-sama berhasil menyelesaikan tugas pembersihan data laboratorium, perbaikan kode pemrograman, hingga analisis penalaran rumit dengan sempurna tanpa ada kesalahan.
Mengutip laporan dari hasil uji coba tersebut, Fable 5 bahkan sempat mencatat waktu pengerjaan lebih cepat serta biaya lebih murah pada tes sensor tingkat lanjut karena penggunaan token yang lebih efisien dibandingkan versi terbarunya.
Dari analisis Kabayan News, peningkatan performa yang ditawarkan Claude Fable 5.1 tampaknya lebih berasa pada tugas agen riset jangka panjang yang kompleks, sementara untuk kebutuhan sehari-hari pengguna mungkin tidak akan merasakan perubahan yang mencolok.