Compiler un LLM sur un Hailo 10H, un shithole sans fond

Pourquoi ce projet Le Hailo-10H, c’est le NPU que Hailo vend pour faire tourner des LLM sur du Raspberry Pi 5 (et autres SBC). Contrairement à ses cousins orientés vision, celui-là est pensé dès le silicium pour ça : 8 Go de LPDDR4 embarqués à bord ! Dans un premier temps, j’ai testé ma puce avec hailo-ollama, le “Ollama-like” maison de Hailo qui pilote leurs modèles précompilés. Je me suis amusé deux minutes, et je me suis vite fait chier. Les modèles proposés sont lents, et surtout limités à une liste bien précise : ...

août 11, 2026 · 24 min · Léo Nonnenmacher

Mon premier projet avec un NPU (Hailo‑8L) : de MNIST à l’inférence embarquée

🎯 Pourquoi ce projet ? Au départ, je pensais que le Hailo‑8L c’était un genre de puce magique : Où tu peux run des LLM, l’utilisé en tant que device sur des framework comme Tensorflow, faire de l’entrainement de model, Spoiler : Absolument pas En creusant un peu, j’ai compris que le Hailo‑8L est fait uniquement pour faire de l’inférence, pas d’entraînement, et encore moins du [Reinforcement Learning] ou autre LLM en tout genre. ...

juin 27, 2025 · 6 min · Léo Nonnenmacher