JAKARTA — OpenTPU menguji apakah agen kecerdasan buatan dapat merancang akselerator AI yang kelak menjalankan inferensinya sendiri. Proyek sumber terbuka ini menjalankan model bahasa pada kartu FPGA, sekaligus membuka rancangan perangkat keras, perangkat lunak, dan alat pengukurnya untuk dipelajari.
Pengembang OpenTPU menyebut proyek ini membawa pelajaran dari auto-arch-tournament ke desain akselerator AI. Pertanyaannya bukan cuma seberapa jauh AI dapat membantu merancang perangkat keras, tetapi juga apakah hasil rancangannya mampu menjalankan inferensi AI secara nyata.
OpenTPU berjalan pada kartu Inspur YPCB-00338 dengan FPGA Xilinx Kintex-7 xc7k480t dan dua kanal DDR3. Menurut dokumentasi proyek, kartu itu menjalankan sepuluh model modern dengan bobot aslinya. Token yang dihasilkan cocok dengan simulator, bit demi bit.
OpenTPU membuka rancangan akselerator AI dari ujung ke ujung
Proyek ini dikemas dalam satu monorepo kecil. Isinya mencakup rancangan perangkat keras dengan SystemVerilog, set instruksi, simulator yang menjaga hasil tetap presisi, bahasa kernel dan kompilernya, serta perangkat lunak host untuk mengendalikan kartu PCIe.
Susunan itu membuat OpenTPU bisa dipakai sebagai bahan belajar, bukan sekadar perangkat untuk mengejar kecepatan. Pengembang dapat mengikuti alur komputasi dari operasi perkalian matriks dalam Python sampai instruksi yang menggerakkan perangkat keras.
Mesinnya sengaja dibuat sederhana. Sebuah sequencer mengeluarkan satu instruksi per siklus ke beberapa unit: DMA memindahkan data, unit matriks mengalikan bobot int8 dari DRAM, unit vektor mengerjakan operasi fp32, lalu quantizer mengubah hasil kembali menjadi int8.
Tidak ada cache atau penjadwalan tersembunyi. Perpindahan data harus dinyatakan sebagai instruksi, sehingga jejak eksekusi dapat menunjukkan bagian mana yang bekerja dan bagian mana yang menunggu. Alat profiler Lens menampilkan rekaman dari RTL, simulator, atau kartu lewat peramban, lengkap dengan lini masa dan tabel instruksi.
Kecepatan OpenTPU dibatasi lalu lintas memori
Pengujian mencatat kartu memakai DDR3-1066 dengan bandwidth puncak 17,1 GB/s. Build B, yang mulai digunakan untuk produksi setelah pengujian pada 2026-10-01, mendekode sejumlah model 8-9 persen lebih cepat daripada citra produksi sebelumnya. Untuk Gemma 4 E2B, peningkatannya 10 persen.

📝 Tinggalkan Komentar
Komentar sebagai . Ditinjau admin sebelum tampil.