Open Weights & modèles locaux
Une pratique Claude-native ne se comprend qu'avec son complément open-weight
Ancrer une pratique sur Anthropic ne veut pas dire s'y enfermer. Un cabinet sérieux doit pouvoir répondre quand un client demande « et si demain vous n'avez plus accès au modèle frontier ? ». Notre réponse : ce qui suit.
Pourquoi une pratique open-weight
Quatre raisons qui ne sont pas idéologiques mais opérationnelles.
Résilience
Un fournisseur central peut, à tout moment, restreindre, suspendre ou dégrader l'accès à un modèle frontier, pour des raisons réglementaires, commerciales, ou opérationnelles. Une pratique open-weight est une assurance : le code continue de tourner.
Gouvernance libre
Poids ouverts + audit public = transparence vérifiable. La sécurité d'un modèle ne se démontre pas par sa fermeture, elle se démontre par la possibilité qu'a la communauté de l'inspecter. La meilleure gouvernance est celle qui est libre et partagée.
Souveraineté du code
Pour un client français ou EU, faire tourner l'IA sur sa propre infrastructure (ou hors des juridictions du fournisseur historique) devient une exigence, pas un caprice. L'open-weight est le seul chemin qui rend cette exigence tenable techniquement.
Alternatives frontier
GLM 5.2 (Z.ai), Kimi K3 (Moonshot), DeepSeek. Sans ces modèles, le marché frontier serait un monopole. Notre pratique intègre ces alternatives dans la boîte à outils réelle, pas seulement dans un discours.
Les modèles utilisés
Ce qu'on fait tourner en pratique : local ou distant, dense ou MoE, texte ou multimodal.
ornith
local · 35B Q8ornith-1.0-35b-heretic-q8_0
Un de nos deux 35B locaux quotidiens sur Loom. Chargé en Q8 depuis le NVMe (~15 s), decode ~14 t/s en offload MoE, contexte calibré 24576 tokens sur la machine de banc.
aganta1
local · 35B Q8agents-a1-35b-abliterated-q8_0
L'autre 35B local qu'on fait tourner en parallèle. Même classe de mémoire, comportement complémentaire à ornith selon les tâches d'agent.
glm-zai
API distante · défautGLM (Z.ai)
Notre modèle distant par défaut (config/local.toml). API OpenAI-compatible, remises de cache 94-98 % mesurées, une alternative frontier concrète au tarif réel.
glm-flash
API distante · dispatchGLM Flash (Z.ai)
Modèle utilisé pour les sous-agents (dispatch_agent) : premier essai gratuit, chaîne de repli vers glm-zai. Optimise le coût des tâches courtes.
kimi-k3
API distante · long-contextKimi K3 (Moonshot AI)
Modèle exploré pour l'ingestion de gros corpus documentaires. Câblé côté remote dans notre store de modèles.
Cette liste n'est pas un catalogue commercial, c'est ce qu'on charge et fait tourner concrètement. Les hébergeurs (Hugging Face pour la distribution, Z.ai / OpenRouter pour les distants) font partie du même écosystème.
La stack
Les briques qu'on utilise, comment elles s'assemblent, pourquoi elles.
Runtime
llama.cpp
moteur d'inférence, roi du GGUF et de l'offload CPU/GPU
llama-swap
proxy multi-modèles avec hot-swap sans redémarrage
vLLM
alternative datacenter (batching continu, PagedAttention) : quand le matos suit
Distribution
Hugging Face
hub central des poids ouverts, formats GGUF/safetensors, huggingface-hub CLI
Format GGUF
conteneur binaire quantizé (Q4, Q8) pour l'inférence CPU/GPU
Techniques
Quantization
Q4 / Q8 : compression 16→4/8 bits, divise mémoire et débit nécessaires
MoE + offload
Mixture of Experts : experts en RAM, attention en VRAM. Rend le 24B+ jouable
KV cache
mémoire de travail de la conversation : clé de la latence
Outillage
uv
gestionnaire Python moderne, remplace pip/venv
Playwright
vérification headless du rendu (pour que l'agent PROUVE qu'une page marche)
ruff
lint/format Python, hook post-tool-use pour tenir la qualité
Notre position, en une phrase
La meilleure gouvernance de l'IA est celle qui est libre et partagée. Sans les acteurs open-weight (GLM, Kimi, Gemma, Qwen, DeepSeek), le marché frontier serait un monopole, et le discours « on vous protège » deviendrait sans contre-pouvoir.
Ce n'est pas un choix contre Anthropic, dont on utilise Claude en production sur plusieurs déploiements. C'est un choix pour la résilience : deux jambes valent mieux qu'une, même très bonne.
Intéressé par cette approche ?
On peut discuter d'un pilote open-weight sur votre stack : local, hybride, ou en fallback d'une intégration frontier existante.