Temuan ini penting bagi pengembangan AI karena kemampuan mengerjakan bagian-bagian riset belum otomatis berarti sistem sanggup melakukan riset secara utuh. AI mungkin dapat membantu rekayasa perangkat lunak atau pembuatan dataset, tetapi proyek penelitian juga menuntut pemilihan masalah, perumusan hipotesis, evaluasi bukti, dan keputusan untuk mengubah arah ketika hasil tidak memuaskan.
Bagi laboratorium dan industri AI, jarak itu berpengaruh pada cara mereka menilai klaim otomatisasi. Keberhasilan menyelesaikan tugas pemrograman atau mengoptimalkan metrik tertentu belum cukup untuk menyimpulkan bahwa AI bisa menggantikan keseluruhan proses penelitian. InnovationEval mencoba menguji klaim yang lebih luas melalui hasil yang dapat dibandingkan dengan riset manusia.
Namun, pengujian ini masih memiliki batas. Menjadikan makalah yang sudah ada sebagai acuan membantu memastikan tugasnya bisa dilakukan dan memberi gambaran tentang kebutuhan komputasi. Sebaliknya, pendekatan itu menyulitkan penilaian otomatis secara penuh dan membatasi jumlah percobaan karena setiap upaya membutuhkan sumber daya besar.
Tugas baru diperlukan saat model mulai mengenali ujiannya
Masalah lain muncul ketika model berikutnya mengetahui tugas yang dipakai dalam evaluasi. Tim menyebut Claude Fable 5 dan GPT-5.6 Sol sebagai model utama dalam hasil mereka; saat diminta mengingat atau menebak rincian makalah tanpa pencarian, keduanya tidak menunjukkan tanda menghafal tugas.
Situasinya berubah pada penerus model tersebut. Claude Fable 5.1 dan GPT-6 Astra telah mengetahui tugas yang digunakan. Jika model mengenali makalah atau target evaluasi, hasil pengujian dapat mencerminkan pengetahuan sebelumnya, bukan kemampuan menemukan inovasi secara mandiri.
Karena itu, tim berencana terus memeriksa kemungkinan model menghafal tugas dan menandai hasil yang terdampak. Mereka juga akan merancang tugas baru bila diperlukan agar evaluasi tetap mengukur kemampuan riset, bukan kemampuan mengenali jawaban yang sudah pernah ditemui.
InnovationEval masih berada pada tahap hasil awal. Tim akan memperluas metodologi dan mengulang pengujian; langkah berikutnya itu akan menunjukkan apakah model dapat bergerak dari eksperimen berbiaya besar menuju inovasi yang benar-benar menyamai capaian manusia.

📝 Tinggalkan Komentar
Komentar sebagai . Ditinjau admin sebelum tampil.