Figure-toi · édition n° 2

DeepSeek publie son harness, et il tourne sur votre machine

Quatre maisons ont publié cette semaine sur la même pièce, et cette pièce n'est pas le modèle. C'est le harness : le programme qu'on met autour, et qui lui donne des mains. On le démonte aujourd'hui. Nouveauté à partir de ce numéro : une rubrique de plus, « Mise en pratique », où l'on ne raconte rien — on fait. Le lien pour partir est en haut.

Date
vendredi 14 août 2026
Lecture
17 min
Rubriques
6
Sujets
12

Rubrique

Analyse de fond

1 sujet

#
Trois plaques de verre reliées : le modèle propose, le harness agit et le résultat revient.

Le modèle ne fait que du texte : DeepSeek a publié le programme qui exécute à sa place

Le laboratoire chinois DeepSeek a publié le code d'un harness d'agents, en avant-première pour développeurs. Un agent, ici, c'est un programme qui enchaîne seul des commandes jusqu'à finir une tâche. La page de présentation ne porte ni date, ni numéro de version. Le dépôt public sur GitHub, lui, a été créé le 13 août 2026.

Un modèle ne fait qu'une chose : on lui envoie du texte, il rend du texte. Il ne touche ni disque, ni terminal, ni réseau. Le programme qui l'entoure et agit à sa place s'appelle un harness. On ne le traduit pas, et c'est le mot que vous croiserez partout. À chaque tour, il décrit les outils au modèle, lit sa réponse, exécute vraiment la commande, puis lui renvoie le résultat dans le texte suivant. Proposer, exécuter, réinjecter.

Ce harness n'est pas un bloc compilé. Il repose sur un micro-noyau, Cordis, qui monte et démonte des modules à chaud. Le modèle, les outils, le bac à sable où s'exécutent les commandes, la boucle elle-même : tout se change en configuration. Vous connaissez le geste. C'est un module qu'on charge dans un noyau, pas un binaire qu'on recompile.

Ce texte, le seul que le modèle reçoive, porte un nom : le contexte. Tout ce qui y entre part dans un journal en ajout seul. Les instructions système, la reasoning trace — le brouillon que le modèle s'écrit avant de répondre —, les appels d'outils, les résultats. Rien n'est réécrit, tout s'empile : la session se rejoue à l'identique, donc elle s'audite. Une seule commande lance le tout, et l'interface tourne sur votre machine, à l'adresse 127.0.0.1:3080.

C'est le chef d'atelier derrière sa vitre. Il ne voit que ce qu'on pose sur sa table, il écrit des ordres, un apprenti les exécute et rapporte le résultat. Là où l'image casse : le chef d'atelier se souvient de la semaine dernière. Le modèle ne connaît que la feuille posée devant lui, et c'est le harness qui l'écrit.

La page ne donne aucun chiffre de performance. Le registre npm affiche 0.1.0-rc.6, publiée le 13 août. Six release candidates en trois jours : ce n'est pas un logiciel stabilisé. Les scores qui circulent viennent de l'annonce d'un modèle, déclarés par le fournisseur, et ne mesurent pas ce code. Le dépôt dépassait 94 000 étoiles en un peu plus de vingt-quatre heures : un compteur de signets, pas un usage.

Le code du harness est sous licence MIT. Ce que cela change tient en une ligne : le code tourne sur vos machines, et vous choisissez le modèle. Mais MIT couvre ce code, pas les weights du modèle, ces paramètres appris à l'entraînement. Et le profil d'installation par défaut réclame une clé d'accès chez DeepSeek, en Chine. Un autre fournisseur se configure, mais il faut le faire.

Trois modules de verre reliés : un signal entre, traverse un engrenage, devient une action puis revient par une boucle claire.
SchémaLe modèle ne touche à rien. Le harness exécute à sa place, et lui replace le résultat dans le texte suivant.
Source DeepSeek page non datée, relevée le 14 août 2026en anglais

Rubrique

Mécanismes

2 sujets

#

Trente agents identiques ne font pas trente travailleurs : dix-huit ont créé leur branche git au même nom

Le 13 août 2026, Anthropic a publié sur son site de recherche une page sur ses expériences à plusieurs agents. Le principe ne bouge pas. Une machine virtuelle par agent, un forum commun, un dépôt de code partagé, et une consigne identique mot pour mot. Dans une version précoce de l'expérience « construire un jeu », trente agents ont démarré au même instant.

Un agent, ici, n'est ni un serveur ni un démon. C'est un modèle de langage enfermé dans une boucle logicielle qui lui tend un terminal et des fichiers : le harness. Chaque agent ne voit que son contexte, le texte que son harness lui repasse à chaque tour. Rien ne circule directement de l'un à l'autre : ils ne se croisent que sur ce qu'ils partagent.

De là sort la première panne. Même modèle, mêmes consignes, mêmes décisions. Dix-huit de ces trente agents ont créé une branche git portant le même nom, « mvp-game-loop ». Ce n'est pas de la bêtise. C'est du déterminisme.

La seconde panne coûte plus cher, et vient d'une autre expérience. Des agents devaient y gérer des files de travaux, sur un système à bande passante finie. Sans autre moyen de se coordonner, ils ont noyé la file sous du polling. Sur une seule exécution, elle a reçu 2,4 millions de demandes et en a accepté 117.

C'est le cache qui expire au même instant pour tout le monde. Personne n'a fauté, chaque client redemande sa donnée, et la base tombe. Là où l'image casse : une expiration de cache, vous la décalez au hasard, client par client. Ce qui synchronise ces agents, c'est le modèle lui-même, et il n'a pas ce réglage.

Une troisième expérience lâchait des agents sur des logiciels libres, en quête de failles. Sur un seul modèle, Claude Mythos Preview — le sien —, un groupe coordonné a trouvé 266 failles contre 21. La page nuance aussitôt. Les 21 venaient d'agents lancés sans se parler, cantonnés aux répertoires principaux, et la moitié des failles du groupe coordonné tombaient hors de ces répertoires. À périmètre égal, la page estime les deux méthodes comparables en texte consommé par faille. Publier soi-même ce qui affaiblit son chiffre vedette est à porter à son crédit.

#

Writer n'a pas changé de modèle, seulement sa façon de l'appeler : la tâche passe de 0,21 à 0,12 dollar

Le 13 août 2026, l'éditeur américain Writer a présenté Palmyra X6, un modèle dérivé du modèle chinois GLM-5.2. Mais l'argument de vente n'est pas le modèle : c'est la couche d'appel autour, que l'entreprise dit avoir réécrite. L'entreprise n'est ici que l'occasion. Le mécanisme, lui, vaut chez n'importe quel fournisseur.

Un modèle de langage est une fonction sans état : il ne se souvient de rien d'un appel au suivant. Le harness lui repasse donc tout l'historique à chaque tour. Or l'entrée est facturée au token, ces fragments de mots que le modèle lit. Chaque tour repaie l'historique entier.

Le levier n'est donc pas le modèle, c'est l'ordre des morceaux. Le fournisseur garde une copie déjà calculée du début de la requête. Condition : que ce début soit identique octet pour octet d'un appel au suivant. Ces tokens-là sont facturés nettement moins cher. D'où la règle : consignes système et définitions d'outils dans un préfixe figé, et tout ce qui varie repoussé à la fin.

C'est l'en-tête qu'on modifie d'un espace avant chaque compilation. Rien n'a changé dedans, et tout le projet se recompile. Là où l'image casse : votre compilateur vous fait payer en minutes, et vous les voyez passer. Ici, vous payez en tokens, sur la facture du mois suivant.

Writer publie ses propres mesures, pas une étude indépendante. Elles ont été déposées sur arXiv le 8 juillet, cinq semaines avant l'annonce. À modèles constants, le coût par tâche passe de 0,21 à 0,12 dollar. Seule la couche d'appel avait changé. L'échantillon tient en vingt-deux tâches, comparées à une boucle de référence que Writer a elle-même définie.

Un chiffre plus flatteur circule dans la presse : jusqu'à 50 % d'économies sur des tâches simples que personne ne définit. C'est une estimation de l'éditeur, un plafond, pas une mesure. Le papier n'est relu par aucun pair, et il est signé par l'équipe qui vend le produit. Le gain de qualité, eux-mêmes le disent, est trop faible pour être affirmé à cette taille d'échantillon.

Rubrique

Concept clé

1 sujet

#

Open weights

Les weights sont le fichier de nombres appris pendant l'entraînement. Ce fichier, c'est le modèle. « Open weights » veut dire qu'il se télécharge et s'exécute chez vous. Vous recevez le binaire, jamais les sources : ni le code d'entraînement, ni les données, ni de quoi refaire le modèle. On lit « open source » partout, mais ce n'est pas du logiciel libre au sens où vous l'entendez. DeepSeek publie ainsi V4 Pro 0813 sous licence MIT. Vous pouvez l'exécuter, pas le refabriquer.

Un boîtier de verre ouvert laisse sortir une pile de paramètres violets sur un plateau ; une seconde chambre dépolie reste fermée.
SchémaCe qui sort de l'usine, c'est le résultat. L'usine, elle, ne sort jamais.

Rubrique

Mise en pratique

1 sujet

#
Trois plaques de verre alignent les étapes du protocole, une mesure centrale et une validation finale.

Dix lignes qu'un professionnel aurait jugées complètes : la machine y a réclamé trois à sept manques par passage

Le 24 mars 2026, un ingénieur du laboratoire américain Anthropic a publié la note qui décrit le harness de son équipe. Le montage tournait sur Claude Opus 4.5. Avec cette génération, la compaction ne suffisait pas. Le modèle bâclait la fin, et le context reset — jeter la conversation et en ouvrir une neuve — était devenu indispensable. La note écrit la contrepartie en une phrase. Le reset rend une page blanche, au prix d'un fichier de passation qui porte assez d'état pour que le suivant reprenne.

Puis le revirement. Avec le modèle suivant, Opus 4.6, l'auteur a supprimé les context resets entièrement, ainsi que le découpage en sprints. Deux pièces seulement ont traversé le changement, et il les nomme. Le planner, qui écrit ce qu'il faut faire avant qu'une ligne soit produite. Et l'evaluator, qui note le travail à la place de celui qui l'a fait. Du fichier de passation, la note ne dit rien. Ni retiré, ni gardé : nous ne trancherons donc pas à sa place.

L'énoncé général explique le reste. Chaque pièce du harness encode une chose que le modèle ne sait pas faire seul. Le modèle progresse, la pièce ne sert plus, elle se retire. Une recommandation d'expert a donc une date de péremption, et celle-ci l'écrit elle-même.

Le geste qui suit fabrique à la main les deux pièces qui ont survécu. Il produit un seul objet : l'état d'un travail en cours, écrit pour que la reprise parte de la page et non de votre mémoire. Il ne coûte rien d'autre que l'abonnement que vous avez déjà.

1. Prenez un travail en cours que vous connaissez bien, et qui n'est pas fini. Un dossier, une note, un tableau.

2. Écrivez à la main, en dix lignes maximum, quatre choses et pas une de plus. Ce qui est fait. Ce qui vient ensuite. Ce à quoi il ne faut pas toucher. Comment on vérifie que ça marche encore.

3. Ouvrez une conversation neuve, où la machine ne garde rien de ce que vous lui avez dit avant. Collez ce fichier, et rien d'autre. Puis recopiez ce qui suit :

Tu reprends un travail en cours dont tu n'as aucune mémoire. Tu ne disposes que de l'état ci-dessus.

COMPRIS : ce que tu comprends de la situation, trois lignes au maximum.

MANQUE : une ligne par information absente qui t'empêche de répondre sans supposer.

S'il ne manque rien, écris exactement « MANQUE : rien ».

Ne commence aucun travail, et ne propose ni méthode ni plan.

4. Notez la première chose qu'elle comprend de travers, ou qu'elle réclame.

5. Une question tranche chaque ajout : connaissiez-vous cette information avant d'ouvrir la conversation ? Oui, elle manque au fichier. Non, c'est une décision que personne n'a prise.

6. Refermez tout, recommencez à l'étape 3, et arrêtez quand elle ne demande plus rien.

C'est l'état des lieux qu'on dresse avant de rendre les clés. Là où l'image casse : un état des lieux se fait à deux, et celui qui entre contresigne. Ici personne ne contresigne, et ce qui n'est pas écrit n'a jamais existé.

La mesure maison, le 14 août. Un fichier troué exprès, quatre manques dont la bonne réponse était connue d'avance. Trois essais chacun, douze passages en conversation neuve. La consigne de l'étape 3 ordonne de lister ce qui manque. Qu'elle réclame ne prouve donc rien, et seul le contenu de ses demandes compte.

Le nombre 53 désignait deux choses dans le même fichier : les doublons fusionnés, et les fiches restées à trancher. Elle a vu la collision. Elle n'a pas refusé de renuméroter les codes clients : elle a demandé s'ils étaient figés ailleurs, en facturation, en comptabilité, dans les exports. Donc si les réattribuer était autorisé. C'est l'interdit que personne n'avait écrit. Elle a réclamé aussi le critère chiffré qui déclare la reprise terminée.

Aucun trou n'a été comblé en douce. Une réserve, écrite noir sur blanc : aucune durée n'a été chronométrée, ni la vôtre ni la sienne. Le modèle employé est Claude Opus 5, un message par essai.

Rubrique

Points de veille

4 sujets

#

L'agent qui écrit le code n'a qu'un seul droit d'écriture, et son relecteur ne lit jamais son raisonnement

L'hébergeur américain Vercel a publié Foreman, un modèle de dépôt libre sous licence MIT. Il transforme un ticket GitHub étiqueté en pull request. Quatre postes s'enchaînent — tri, plan, code, relecture — chacun dans sa propre machine Linux jetable. Aucun n'hérite de rien : ce qu'une étape laisse à la suivante est recopié dans le message d'appel.

Source Vercel page non datée, dépôt créé le 12 août 2026en anglais
#

Cursor ne démarre plus ses agents, il duplique une machine déjà allumée

Le 13 août 2026, l'éditeur américain Cursor a publié sa méthode pour démarrer ses agents distants, ces programmes qui écrivent du code seuls. L'environnement est monté d'avance, puis le disque figé dans une image refaite chaque heure par défaut. Chaque agent part d'une machine déjà allumée qu'on duplique : un fork de processus vivant, pas un démarrage.

#

893 Go de weights déposés sans annonce : le fichier dicte la machine

Le 12 août 2026, DeepSeek a déposé V4 Pro 0813 sur Hugging Face, le dépôt public de modèles, sans page d'annonce ni communiqué. Un modèle ne se lit pas depuis le disque au fil de l'eau : le fichier entier est chargé avant de servir. Les 893 Go, pour 1 700 milliards de paramètres, ne mesurent donc pas un téléchargement. Ils mesurent la machine qu'il faut en face.

#

Gemini 3.7 Flash est à moitié prix jusqu'au 31 décembre, et la 3.6 reste au plein tarif

Le 13 août 2026, Google a sorti son modèle Gemini 3.7 Flash, trois semaines après la 3.6, à moitié prix pour le lancement. Vous payez au token, ce fragment de mot d'environ quatre caractères. La remise court jusqu'au 31 décembre 2026 inclus.

Rubrique

Lectures de référence

3 sujets

#

Une seule application construite par un harness : 71,08 dollars pour la première passe

Un ingénieur d'Anthropic décrit le harness monté autour d'un modèle : un planner, un builder, un evaluator, qui ne se parlent que par fichiers. Vous y lisez la facture d'une seule exécution : 71,08 dollars la première construction, 3 à 4 dollars chaque passe de contrôle. Le billet se dédit aussi lui-même, ce qui est plus rare. Les context resets, indispensables avec Opus 4.5, ont été retirés entièrement avec Opus 4.6.

#

La reasoning trace chiffrée que le fournisseur vous renvoie a été décodée, clés et mots de passe compris

Un modèle écrit un brouillon pour lui-même avant de répondre — la reasoning trace — et le fournisseur vous la rend chiffrée. L'équipe de l'université de Tübingen montre comment ce bloc se relit en clair. Sur 704 éléments privés retrouvés dans de vraies sessions, bancs d'essai exclus, 64 n'existaient que dans ce brouillon. Anthropic, OpenAI et Google ont accusé réception du signalement. Les auteurs disent ne plus parvenir à reproduire l'attaque, et aucune date de correctif n'est publiée.

#

Le fil de X se lit étage par étage, et l'étiquette posée sur votre compte se télécharge

Le fil « Pour vous » du réseau social X, anciennement Twitter, avait déjà été ouvert en 2023 sous licence AGPL. Le 13 août 2026, X a élargi la publication dans le dépôt xai-org/x-algorithm, sous Apache 2.0, pondérations du classement comprises. L'onglet « Under the Hood » vous rend en plus un fichier : les étiquettes posées sur votre compte le mois écoulé. Une étiquette est la marque qu'un programme de tri colle sur un compte, et dont les filtres se servent ensuite. Réservé à un groupe pilote de comptes d'au moins un an, à partir de 10 messages dans le mois.