Minggu, 11 Oktober 2026 WIB
BREAKING
TEKNOLOGI

InnovationEval: AI Kesulitan Menyamai Inovasi Riset Manusia

InnovationEval
InnovationEval

InnovationEval menguji apakah AI mampu menemukan inovasi pembelajaran mesin yang menyamai hasil riset manusia. Dalam hasil awal, model AI mutakhir hanya membuat sedikit kemajuan meski menjalankan eksperimen dengan biaya komputasi GPU hingga ribuan dolar.

Evaluasi ini mengukur kemampuan AI menjalankan proyek riset dari awal sampai akhir: merancang gagasan, menerapkannya, menguji hasil, lalu memperbaiki pendekatan. Tim pengembang InnovationEval menyatakan akan memperluas dan mengulang pengujian untuk memantau perkembangan otomatisasi riset AI.

Fokus uji kali ini adalah mencari metode pascapelatihan baru yang dapat mengungguli tolok ukur GRPO. Agen AI diminta melatih model Qwen3-8B pada tugas menjawab pertanyaan singkat dan pemrograman, lalu menunjukkan bahwa metodenya berhasil.

InnovationEval menguji inovasi, bukan sekadar menyusun teknik

Perbedaan utama InnovationEval dari sejumlah evaluasi lain terletak pada tuntutan untuk menghasilkan inovasi. Tugas yang jawabannya sudah terdefinisi dengan jelas dapat mengukur kemampuan teknis, tetapi belum tentu membuktikan bahwa AI mampu menemukan pendekatan baru.

Dalam uji ini, peningkatan metrik tanpa melanggar batas tugas seharusnya membutuhkan metode yang belum pernah dilihat AI saat pelatihan. Agen harus melewati seluruh siklus riset, mulai dari menyusun ide hingga membaca hasil eksperimen dan mengulang percobaan. Dengan begitu, penilaian tidak hanya mengukur apakah AI bisa menjalankan instruksi.

Tim menetapkan target berdasarkan makalah yang ditulis peneliti manusia. Pendekatan itu memberi pembanding konkret: sistem AI harus berusaha mencapai peningkatan yang sebelumnya telah dicapai metode manusia, bukan sekadar memperbaiki angka pada tugas tanpa tolok ukur yang jelas.

Penguji memilih inovasi bernama on-policy self-distillation atau SDPO sebagai pijakan. Teknik itu dipilih karena telah diadopsi dan dikutip oleh model-model baru. Tim kemudian meminta agen merancang teknik pascapelatihan baru untuk mengalahkan baseline GRPO, dengan sasaran menghasilkan temuan yang layak memajukan bidang tersebut.

Hasil awal masih jauh dari pembuktian otomatisasi riset

Hasil awal menunjukkan model frontier yang diuji hanya mencatat kemajuan kecil. Eksperimen mereka memerlukan komputasi GPU senilai ribuan dolar, tetapi upaya tersebut belum menunjukkan bahwa model dapat secara mandiri menghasilkan inovasi sebanding dengan capaian peneliti manusia.

Halaman:12Semua Halaman

(PE)

📲
Ikuti JournalArta News di Telegram

Dapatkan berita terbaru Bangka Belitung & nasional langsung di Telegram Anda. Gratis, no spam.

💬 Follow @journalartanews →
Bagikan: Facebook Twitter Telegram

Artikel Untuk Anda

TRENDING Kode Redeem FC Mobile Terbaru Hari Ini 11 Oktober 2026: Klaim Pack & Coins Gratis