La deuxième jambe

Open Weights & modèles locaux

Une pratique Claude-native ne se comprend qu'avec son complément open-weight

Ancrer une pratique sur Anthropic ne veut pas dire s'y enfermer. Un cabinet sérieux doit pouvoir répondre quand un client demande « et si demain vous n'avez plus accès au modèle frontier ? ». Notre réponse : ce qui suit.

Pourquoi une pratique open-weight

Quatre raisons qui ne sont pas idéologiques mais opérationnelles.

Résilience

Un fournisseur central peut, à tout moment, restreindre, suspendre ou dégrader l'accès à un modèle frontier, pour des raisons réglementaires, commerciales, ou opérationnelles. Une pratique open-weight est une assurance : le code continue de tourner.

Gouvernance libre

Poids ouverts + audit public = transparence vérifiable. La sécurité d'un modèle ne se démontre pas par sa fermeture, elle se démontre par la possibilité qu'a la communauté de l'inspecter. La meilleure gouvernance est celle qui est libre et partagée.

Souveraineté du code

Pour un client français ou EU, faire tourner l'IA sur sa propre infrastructure (ou hors des juridictions du fournisseur historique) devient une exigence, pas un caprice. L'open-weight est le seul chemin qui rend cette exigence tenable techniquement.

Alternatives frontier

GLM 5.2 (Z.ai), Kimi K3 (Moonshot), DeepSeek. Sans ces modèles, le marché frontier serait un monopole. Notre pratique intègre ces alternatives dans la boîte à outils réelle, pas seulement dans un discours.

Les modèles utilisés

Ce qu'on fait tourner en pratique : local ou distant, dense ou MoE, texte ou multimodal.

ornith

local · 35B Q8

ornith-1.0-35b-heretic-q8_0

Un de nos deux 35B locaux quotidiens sur Loom. Chargé en Q8 depuis le NVMe (~15 s), decode ~14 t/s en offload MoE, contexte calibré 24576 tokens sur la machine de banc.

GGUF Q8llama.cppflash-attn-ngl 99

aganta1

local · 35B Q8

agents-a1-35b-abliterated-q8_0

L'autre 35B local qu'on fait tourner en parallèle. Même classe de mémoire, comportement complémentaire à ornith selon les tâches d'agent.

GGUF Q8llama.cppflash-attn

glm-zai

API distante · défaut

GLM (Z.ai)

Notre modèle distant par défaut (config/local.toml). API OpenAI-compatible, remises de cache 94-98 % mesurées, une alternative frontier concrète au tarif réel.

API OpenAI-compatcache_controlstreaming

glm-flash

API distante · dispatch

GLM Flash (Z.ai)

Modèle utilisé pour les sous-agents (dispatch_agent) : premier essai gratuit, chaîne de repli vers glm-zai. Optimise le coût des tâches courtes.

API OpenAI-compatdispatch subagent

kimi-k3

API distante · long-context

Kimi K3 (Moonshot AI)

Modèle exploré pour l'ingestion de gros corpus documentaires. Câblé côté remote dans notre store de modèles.

API distantelong context

Cette liste n'est pas un catalogue commercial, c'est ce qu'on charge et fait tourner concrètement. Les hébergeurs (Hugging Face pour la distribution, Z.ai / OpenRouter pour les distants) font partie du même écosystème.

La stack

Les briques qu'on utilise, comment elles s'assemblent, pourquoi elles.

Runtime

  • llama.cpp

    moteur d'inférence, roi du GGUF et de l'offload CPU/GPU

  • llama-swap

    proxy multi-modèles avec hot-swap sans redémarrage

  • vLLM

    alternative datacenter (batching continu, PagedAttention) : quand le matos suit

Distribution

  • Hugging Face

    hub central des poids ouverts, formats GGUF/safetensors, huggingface-hub CLI

  • Format GGUF

    conteneur binaire quantizé (Q4, Q8) pour l'inférence CPU/GPU

Techniques

  • Quantization

    Q4 / Q8 : compression 16→4/8 bits, divise mémoire et débit nécessaires

  • MoE + offload

    Mixture of Experts : experts en RAM, attention en VRAM. Rend le 24B+ jouable

  • KV cache

    mémoire de travail de la conversation : clé de la latence

Outillage

  • uv

    gestionnaire Python moderne, remplace pip/venv

  • Playwright

    vérification headless du rendu (pour que l'agent PROUVE qu'une page marche)

  • ruff

    lint/format Python, hook post-tool-use pour tenir la qualité

Notre position, en une phrase

La meilleure gouvernance de l'IA est celle qui est libre et partagée. Sans les acteurs open-weight (GLM, Kimi, Gemma, Qwen, DeepSeek), le marché frontier serait un monopole, et le discours « on vous protège » deviendrait sans contre-pouvoir.

Ce n'est pas un choix contre Anthropic, dont on utilise Claude en production sur plusieurs déploiements. C'est un choix pour la résilience : deux jambes valent mieux qu'une, même très bonne.

Intéressé par cette approche ?

On peut discuter d'un pilote open-weight sur votre stack : local, hybride, ou en fallback d'une intégration frontier existante.