Menurut dokumentasi proyek, format ini mengurangi data per token sekitar sepertiga dan menaikkan kecepatan decode 40 persen untuk Qwen3.5 serta 45 persen untuk Qwen3 dan LFM2. Imbalannya, perplexity berubah dan dilaporkan per model.
Pengembang juga menjelaskan cara pengukuran. Decode standar memakai 64 token greedy setelah prompt 512 token, dengan pemilihan argmax dilakukan host dan bukan melalui streaming. Angka “device” hanya menghitung siklus kerja akselerator, sedangkan “wall” turut memasukkan waktu host. Lalu lintas DRAM berasal dari pencatat internal kartu.
Pada Gemma 4 E2B, tabel embedding tiap lapisan disimpan di kartu dengan citra 3,5-3,6 GiB; versi int8 tidak muat. Untuk E4B, tabel 2,95 GB tetap di host dan host menyalin satu baris 11 KB ke kartu per token. Rincian seperti ini membantu pembaca memahami mengapa hasil setiap model bergantung pada konfigurasi dan susunan memorinya.
Kalibrasi memori juga berlangsung di kartu. Saat citra dimulai, CPU kecil di inti memori mengalibrasi kedua kanal DDR3 dalam 12 s tanpa bantuan host. Dengan begitu, proyek ini tidak hanya membagikan hasil performa, tetapi juga memperlihatkan bagian teknis yang biasanya tersembunyi di balik angka benchmark.
Dokumentasi OpenTPU mencatat citra Qwen3.5-4B int8 berukuran lebih dari 4 GiB, melewati kapasitas kartu. Untuk model sebesar itu, pengembang memakai konfigurasi bobot yang lebih hemat atau mengalirkan pakar dari host.

📝 Tinggalkan Komentar
Komentar sebagai . Ditinjau admin sebelum tampil.