InnovationEval menguji apakah AI mampu menemukan inovasi pembelajaran mesin yang menyamai hasil riset manusia. Dalam hasil awal, model AI mutakhir hanya membuat sedikit kemajuan meski menjalankan eksperimen dengan biaya komputasi GPU hingga ribuan dolar.
Evaluasi ini mengukur kemampuan AI menjalankan proyek riset dari awal sampai akhir: merancang gagasan, menerapkannya, menguji hasil, lalu memperbaiki pendekatan. Tim pengembang InnovationEval menyatakan akan memperluas dan mengulang pengujian untuk memantau perkembangan otomatisasi riset AI.
Fokus uji kali ini adalah mencari metode pascapelatihan baru yang dapat mengungguli tolok ukur GRPO. Agen AI diminta melatih model Qwen3-8B pada tugas menjawab pertanyaan singkat dan pemrograman, lalu menunjukkan bahwa metodenya berhasil.
InnovationEval menguji inovasi, bukan sekadar menyusun teknik
Perbedaan utama InnovationEval dari sejumlah evaluasi lain terletak pada tuntutan untuk menghasilkan inovasi. Tugas yang jawabannya sudah terdefinisi dengan jelas dapat mengukur kemampuan teknis, tetapi belum tentu membuktikan bahwa AI mampu menemukan pendekatan baru.
Dalam uji ini, peningkatan metrik tanpa melanggar batas tugas seharusnya membutuhkan metode yang belum pernah dilihat AI saat pelatihan. Agen harus melewati seluruh siklus riset, mulai dari menyusun ide hingga membaca hasil eksperimen dan mengulang percobaan. Dengan begitu, penilaian tidak hanya mengukur apakah AI bisa menjalankan instruksi.
Tim menetapkan target berdasarkan makalah yang ditulis peneliti manusia. Pendekatan itu memberi pembanding konkret: sistem AI harus berusaha mencapai peningkatan yang sebelumnya telah dicapai metode manusia, bukan sekadar memperbaiki angka pada tugas tanpa tolok ukur yang jelas.
Penguji memilih inovasi bernama on-policy self-distillation atau SDPO sebagai pijakan. Teknik itu dipilih karena telah diadopsi dan dikutip oleh model-model baru. Tim kemudian meminta agen merancang teknik pascapelatihan baru untuk mengalahkan baseline GRPO, dengan sasaran menghasilkan temuan yang layak memajukan bidang tersebut.
Hasil awal masih jauh dari pembuktian otomatisasi riset
Hasil awal menunjukkan model frontier yang diuji hanya mencatat kemajuan kecil. Eksperimen mereka memerlukan komputasi GPU senilai ribuan dolar, tetapi upaya tersebut belum menunjukkan bahwa model dapat secara mandiri menghasilkan inovasi sebanding dengan capaian peneliti manusia.
Temuan ini penting bagi pengembangan AI karena kemampuan mengerjakan bagian-bagian riset belum otomatis berarti sistem sanggup melakukan riset secara utuh. AI mungkin dapat membantu rekayasa perangkat lunak atau pembuatan dataset, tetapi proyek penelitian juga menuntut pemilihan masalah, perumusan hipotesis, evaluasi bukti, dan keputusan untuk mengubah arah ketika hasil tidak memuaskan.
Bagi laboratorium dan industri AI, jarak itu berpengaruh pada cara mereka menilai klaim otomatisasi. Keberhasilan menyelesaikan tugas pemrograman atau mengoptimalkan metrik tertentu belum cukup untuk menyimpulkan bahwa AI bisa menggantikan keseluruhan proses penelitian. InnovationEval mencoba menguji klaim yang lebih luas melalui hasil yang dapat dibandingkan dengan riset manusia.
Namun, pengujian ini masih memiliki batas. Menjadikan makalah yang sudah ada sebagai acuan membantu memastikan tugasnya bisa dilakukan dan memberi gambaran tentang kebutuhan komputasi. Sebaliknya, pendekatan itu menyulitkan penilaian otomatis secara penuh dan membatasi jumlah percobaan karena setiap upaya membutuhkan sumber daya besar.
Tugas baru diperlukan saat model mulai mengenali ujiannya
Masalah lain muncul ketika model berikutnya mengetahui tugas yang dipakai dalam evaluasi. Tim menyebut Claude Fable 5 dan GPT-5.6 Sol sebagai model utama dalam hasil mereka; saat diminta mengingat atau menebak rincian makalah tanpa pencarian, keduanya tidak menunjukkan tanda menghafal tugas.
Situasinya berubah pada penerus model tersebut. Claude Fable 5.1 dan GPT-6 Astra telah mengetahui tugas yang digunakan. Jika model mengenali makalah atau target evaluasi, hasil pengujian dapat mencerminkan pengetahuan sebelumnya, bukan kemampuan menemukan inovasi secara mandiri.
Karena itu, tim berencana terus memeriksa kemungkinan model menghafal tugas dan menandai hasil yang terdampak. Mereka juga akan merancang tugas baru bila diperlukan agar evaluasi tetap mengukur kemampuan riset, bukan kemampuan mengenali jawaban yang sudah pernah ditemui.
InnovationEval masih berada pada tahap hasil awal. Tim akan memperluas metodologi dan mengulang pengujian; langkah berikutnya itu akan menunjukkan apakah model dapat bergerak dari eksperimen berbiaya besar menuju inovasi yang benar-benar menyamai capaian manusia.

📝 Tinggalkan Komentar
Komentar sebagai . Ditinjau admin sebelum tampil.