Rabu, 7 Oktober 2026 WIB
BREAKING
TEKNOLOGI

OpenTPU, Akselerator AI Sumber Terbuka yang Merancang Diri

OpenTPU akselerator AI sumber terbuka pada kartu FPGA
Kartu FPGA menjalankan model AI dalam proyek OpenTPU yang membuka rancangan perangkat keras dan perangkat lunaknya. (Ilustrasi: AI)

Build B memakai 91-94 persen dari puncak DRAM, naik dari 82-87 persen pada citra sebelumnya. Namun, peningkatan itu tidak membuat semua model lebih cepat secara merata. Pengembang menyatakan proses decode terikat oleh bandwidth DRAM, dan pembacaan LiteDRAM berada pada 82-85 persen dari puncak DDR3, serupa dengan MIG pada citra sebelumnya.

Pada pengujian yang membandingkan citra baru dengan se-cand3, kecepatan decode berada dalam selisih 2,3 persen di setiap konfigurasi. Keuntungan paling jelas muncul pada prefill, yakni pemrosesan prompt: kecepatannya meningkat 1,3 kali untuk Qwen3.5 hingga 2,0 kali untuk LFM2 4-bit.

Perbedaan itu penting karena laju komputasi chip bukan satu-satunya penentu pengalaman menjalankan model. Data bobot harus terus bergerak dari memori ke unit pemroses. Saat jalur memori sudah sibuk, menambah kemampuan hitung saja belum tentu membuat token keluar lebih cepat.

Model besar mengandalkan pemindahan bobot dari host

Sejumlah model campuran pakar (mixture of experts) melampaui kapasitas kartu sebesar 4 GiB. OpenTPU menjalankannya dengan menyimpan pakar di penyimpanan host, lalu memindahkan pakar yang belum tersedia ke slot DRAM kartu. Kartu menentukan pakar yang dipakai untuk setiap token dan mengerjakan komputasinya; host menangani penyalinan data.

Dalam pengukuran pada 2026-10-01 dengan build B, LFM2.5-8B-A1B menghasilkan 10,6 token per detik selama 160 token. Sebanyak 98,5 persen pemakaian pakar mengenai slot yang tersedia, dengan 5,2 MB data dialirkan per token.

Qwen3.5-35B-A3B mencapai 3,95 token per detik, dengan 16 token greedy yang cocok dengan Hugging Face. Tingkat kecocokan pakarnya 62 persen. Sistem mengalirkan 153 MB per token melalui PCIe pada 1,41 GB/s.

Angka itu menunjukkan kompromi yang nyata bagi pengguna dan pengembang: model yang bobotnya lebih besar daripada kapasitas memori kartu tetap dapat dijalankan, tetapi pertukaran data dengan host ikut menentukan kecepatannya. Pengujian ini juga memperlihatkan mengapa angka kinerja perlu dibaca bersama metode pengukurannya, bukan sebagai satu nilai yang berdiri sendiri.

Simulator dan metode pengukuran ikut dibuka

OpenTPU memakai bobot 4-bit berbasis nilai FP4 dengan skala blok dua tingkat. Setiap bobot memakai 4,25 bit, sementara LM head dipertahankan pada int8 untuk menjaga akurasi.

Halaman:123Semua Halaman

(ZA)

📲
Ikuti JournalArta News di Telegram

Dapatkan berita terbaru Bangka Belitung & nasional langsung di Telegram Anda. Gratis, no spam.

💬 Follow @journalartanews →
Bagikan: Facebook Twitter Telegram

Artikel Untuk Anda

TRENDING Kode Redeem Free Fire (FF) Hari Ini 7 Oktober 2026: Klaim Diamond & Skin Gratis