Build B memakai 91-94 persen dari puncak DRAM, naik dari 82-87 persen pada citra sebelumnya. Namun, peningkatan itu tidak membuat semua model lebih cepat secara merata. Pengembang menyatakan proses decode terikat oleh bandwidth DRAM, dan pembacaan LiteDRAM berada pada 82-85 persen dari puncak DDR3, serupa dengan MIG pada citra sebelumnya.
Pada pengujian yang membandingkan citra baru dengan se-cand3, kecepatan decode berada dalam selisih 2,3 persen di setiap konfigurasi. Keuntungan paling jelas muncul pada prefill, yakni pemrosesan prompt: kecepatannya meningkat 1,3 kali untuk Qwen3.5 hingga 2,0 kali untuk LFM2 4-bit.
Perbedaan itu penting karena laju komputasi chip bukan satu-satunya penentu pengalaman menjalankan model. Data bobot harus terus bergerak dari memori ke unit pemroses. Saat jalur memori sudah sibuk, menambah kemampuan hitung saja belum tentu membuat token keluar lebih cepat.
Model besar mengandalkan pemindahan bobot dari host
Sejumlah model campuran pakar (mixture of experts) melampaui kapasitas kartu sebesar 4 GiB. OpenTPU menjalankannya dengan menyimpan pakar di penyimpanan host, lalu memindahkan pakar yang belum tersedia ke slot DRAM kartu. Kartu menentukan pakar yang dipakai untuk setiap token dan mengerjakan komputasinya; host menangani penyalinan data.
Dalam pengukuran pada 2026-10-01 dengan build B, LFM2.5-8B-A1B menghasilkan 10,6 token per detik selama 160 token. Sebanyak 98,5 persen pemakaian pakar mengenai slot yang tersedia, dengan 5,2 MB data dialirkan per token.
Qwen3.5-35B-A3B mencapai 3,95 token per detik, dengan 16 token greedy yang cocok dengan Hugging Face. Tingkat kecocokan pakarnya 62 persen. Sistem mengalirkan 153 MB per token melalui PCIe pada 1,41 GB/s.
Angka itu menunjukkan kompromi yang nyata bagi pengguna dan pengembang: model yang bobotnya lebih besar daripada kapasitas memori kartu tetap dapat dijalankan, tetapi pertukaran data dengan host ikut menentukan kecepatannya. Pengujian ini juga memperlihatkan mengapa angka kinerja perlu dibaca bersama metode pengukurannya, bukan sebagai satu nilai yang berdiri sendiri.
Simulator dan metode pengukuran ikut dibuka
OpenTPU memakai bobot 4-bit berbasis nilai FP4 dengan skala blok dua tingkat. Setiap bobot memakai 4,25 bit, sementara LM head dipertahankan pada int8 untuk menjaga akurasi.

📝 Tinggalkan Komentar
Komentar sebagai . Ditinjau admin sebelum tampil.