Devenir le futur Anthropic avec un GPU de 2020

Pourquoi ce projet ? Dans le post précédent, j’ai fini par faire tourner de l’inférence sur une Tesla T10 récupérée pour 300€ — une carte qui, dans une autre vie, streamait du cloud gaming chez GeForce Now. Sympa, mais soyons honnêtes deux secondes : faire tourner un modèle que quelqu’un d’autre a entraîné, c’est le service minimum syndical. N’importe qui avec ollama pull sait faire ça en trente secondes. Ce qui me démangeait, c’était la partie d’avant. D’où sort le modèle. Comment on passe d’un tas de texte brut à un truc qui aligne des phrases qui tiennent debout. Quand on utilise Claude, ChatGPT ou Mistral au quotidien, on tape un prompt, ça sort une réponse, et entre les deux c’est de la magie noire pour à peu près tout le monde qui s’en sert. ...

août 13, 2026 · 23 min · Léo Nonnenmacher

Compiler un LLM sur un Hailo 10H, un shithole sans fond

Pourquoi ce projet Le Hailo-10H, c’est le NPU que Hailo vend pour faire tourner des LLM sur du Raspberry Pi 5 (et autres SBC). Contrairement à ses cousins orientés vision, celui-là est pensé dès le silicium pour ça : 8 Go de LPDDR4 embarqués à bord ! Dans un premier temps, j’ai testé ma puce avec hailo-ollama, le “Ollama-like” maison de Hailo qui pilote leurs modèles précompilés. Je me suis amusé deux minutes, et je me suis vite fait chier. Les modèles proposés sont lents, et surtout limités à une liste bien précise : ...

août 11, 2026 · 24 min · Léo Nonnenmacher

De l'IA sur des cartes sorties de nulle part

Dans quel but ? Depuis que je m’intéresse à l’IA j’aime bien faire mumuse avec des GPU étranges. Après avoir fait Un setup IA moins cher que Mario Kart World, je me suis demandé si on pouvait héberger des modèles d’IA performants avec des GPU vraiment pas chers. Et spoiler, oui on peut. Mais avec quelques points noirs. Le setup Le setup reste plus ou moins le même que pour l’article précédent. Pour rappel: ...

août 11, 2026 · 31 min · Léo Nonnenmacher

Automatiser la création d'entrées DNS avec Kubernetes et Cloudflare

🖥️ Pourquoi faire ? Automatiser la création d’entrées DNS, ça sonne bien, c’est stylé, mais ça sert à quoi concrètement ? Quand on administre un cluster Kubernetes, un des outils incontournables, c’est l’ingress controller. Il sert de reverse proxy et c’est donc lui qui traite les entrées HTTP/S et vers quelles applications elles vont. graph LR subgraph Entrées DNS A1[one.example.org] A2[two.example.org] A3[three.example.org] end RP[Reverse Proxy] subgraph Backends S1[Server One] S2[Server Two] S3[Server Three] end A1 --> RP A2 --> RP A3 --> RP RP --> S1 RP --> S2 RP --> S3 Ok, donc si mon reverse proxy redirige le traffic vers les bonnes applications en fonction de l’entrée DNS, pourquoi pas faire un wildcard ? ...

juin 30, 2025 · 5 min · Léo Nonnenmacher

Un setup IA moins cher que Mario Kart World ?

🔴 Pourquoi faire de l’IA chez soi ? C’est vrai ça, pourquoi faire de l’IA chez soi ? Et puis d’abord, c’est quoi l’IA ? Qu’est-ce que l’IA ? Selon Wikipedia : L’intelligence artificielle (IA) est la capacité des machines à effectuer des tâches typiquement associées à l’intelligence humaine, comme l’apprentissage, le raisonnement, la résolution de problème, la perception ou la prise de décision. L’intelligence artificielle est également le champ de recherche visant à développer de telles machines ainsi que les systèmes informatiques qui en résultent. ...

juin 29, 2025 · 11 min · Léo Nonnenmacher

Mettre à jour automatiquement un cluster K3s avec System Upgrade Controller

🧠 Pourquoi automatiser les mises à jour K3s ? Garder un cluster à jour, c’est la base : patches de sécu, corrections de bugs, perfs améliorées, etc. Mais dans la vraie vie, surtout quand t’as un cluster auto-hébergé sur du matos hétérogène, bah t’oublies, tu repousses, ou t’as pas le temps. Résultat : t’es vite à la bourre sur les versions. Et c’est là que les emmerdes commencent. Alors j’ai cherché une solution simple, stable, et un peu “Talos-like” pour automatiser ça. ...

juin 27, 2025 · 4 min · Léo Nonnenmacher

Mon premier projet avec un NPU (Hailo‑8L) : de MNIST à l’inférence embarquée

🎯 Pourquoi ce projet ? Au départ, je pensais que le Hailo‑8L c’était un genre de puce magique : Où tu peux run des LLM, l’utilisé en tant que device sur des framework comme Tensorflow, faire de l’entrainement de model, Spoiler : Absolument pas En creusant un peu, j’ai compris que le Hailo‑8L est fait uniquement pour faire de l’inférence, pas d’entraînement, et encore moins du [Reinforcement Learning] ou autre LLM en tout genre. ...

juin 27, 2025 · 6 min · Léo Nonnenmacher