Le 3 août, Alibaba sort Qwen3.8-Max. Deux jours plus tard, Meta lance Muse Code avec Muse Spark 1.2. Le 10, Meta remet un modèle ouvert et compact sur la table avec Muse Glimmer. Le 11, Nvidia ajoute Nemotron 3.5 Lightning et un routeur de modèles. Le 12, SpaceXAI lance Grok 4.6. Le 13, DeepSeek officialise V4 Pro et Google sort Gemini 3.7 Flash. Le 14, Z.ai présente GLM-5.3, mais annonce qu'il faudra attendre environ deux semaines pour les poids publics.18910111314

Ce calendrier ressemble à une simple semaine de modèles. Il raconte en fait autre chose. La frontière entre “le modèle” et “le produit” devient beaucoup plus visible. Les laboratoires ne vendent plus seulement une matrice de poids ou un endpoint. Ils travaillent aussi sur la boucle qui choisit le contexte, appelle les outils, découpe la tâche, garde l'état, ouvre des sous-agents, vérifie les résultats et décide quand le travail est terminé.

C'est ce que le mot harness désigne de plus en plus souvent. Pas un nouveau synonyme chic pour “agent”, même si l'industrie adore fabriquer trois mots pour un même bouton. Le harness est la couche d'exécution autour du modèle. Sur un agent de code, c'est ce qui transforme “voici un LLM” en “voici quelque chose qui sait lire un dépôt, modifier quatre fichiers, lancer les tests, comprendre l'échec, corriger, conserver un journal et te rendre un patch”.

Le détail est important pour lire correctement les quinze derniers jours. Certaines choses sont réellement sorties, d'autres sont des previews, d'autres encore sont des harnesses, et quelques noms très partagés ne correspondent pas à une nouvelle sortie. Qwen3.8 et Freebuff en donnent deux bons exemples. “DeepSeek Harness” en donne un troisième.

Qwen3.8-Max : la vraie sortie arrive après le preview

Qwen3.8-Max avait déjà été montré en preview le 19 juillet. Alibaba l'avait rendu accessible via Token Plan, Qoder et QoderWork et promettait alors une future publication des poids. La sortie qui tombe dans notre fenêtre est celle du 3 août : Alibaba présente le modèle comme son plus grand et plus capable, à 2 400 milliards de paramètres, dans une architecture Mixture-of-Experts.12

Le chiffre de 2 400 milliards est spectaculaire et, seul, assez peu pratique. Dans un MoE, tous les paramètres ne travaillent pas à chaque token. Le vrai intérêt de la sortie est donc moins “le nombre est gigantesque” que la combinaison visée : modèle frontal, long contexte, multimodalité, code et tâches agentiques, avec une stratégie d'ouverture des poids qui remet la famille Max dans la bataille de l'open weight.1

Une autre évolution est plus facile à rater. Alibaba documente désormais explicitement des Harness tools dans son Token Plan : recherche web, interpréteur de code, extraction de pages, recherche d'images inversée et recherche d'images à partir de texte.3 Autrement dit, une partie de ce que l'on considérait hier comme une propriété du produit autour du modèle commence à être livrée comme une capacité attachée au plan d'accès au modèle.

Documentation Alibaba Cloud consacrée à l’intégration des Harness tools
Alibaba Cloud documente désormais explicitement une couche de « Harness tools » autour de ses modèles : recherche web, exécution de code et extraction de pages notamment.Alibaba Cloud

Cette ouverture a d'ailleurs immédiatement acquis une dimension économique. Reuters rapportait le 7 août qu'Alibaba préparait pour les gros utilisateurs commerciaux une licence inspirée des clauses de partage de revenus déjà vues chez Moonshot.19 Ce n'est pas un détail juridique périphérique. Plus les modèles ouverts deviennent compétitifs, plus “ouvert” cesse de vouloir dire automatiquement “sans contrainte économique pour n'importe quel usage”.

Qwen3.8 résume donc assez bien la période : un modèle plus gros, certes, mais surtout un paquet composé du modèle, de surfaces de travail, d'outils et d'un modèle économique. Le benchmark ne raconte qu'un morceau du produit.

DeepSeek : V4-Flash sur le prix, V4 Pro sur l'agentique

DeepSeek offre presque le miroir inverse. V4 existait déjà en preview depuis avril. Mais à la fin juillet et au début août, V4-Flash passe à une disponibilité officielle qui attire surtout l'attention par son prix : 0,14 dollar par million de tokens d'entrée et 0,28 dollar en sortie au moment de la mesure rapportée par Reuters et Artificial Analysis.4

Le 13 août, DeepSeek pousse V4 Pro. La différence de prix est brutale : Reuters rapporte 1,32 dollar par million de tokens d'entrée et 3,96 dollars en sortie, soit plusieurs fois le tarif de Flash. DeepSeek justifie cette marche par un gain de capacité, notamment sur les agents. V4 Pro est accessible via API, application et web.5

Visuel officiel DeepSeek utilisé dans sa documentation développeur
DeepSeek expose aujourd’hui V4 à travers son API et documente surtout son branchement à des agents tiers. Le modèle et le harness restent deux pièces séparables.DeepSeek

Le 17 août, la grille doit encore changer, avec des tarifs variables selon les heures et des hausses annoncées pour les deux modèles.20 Le cas DeepSeek rappelle donc une évidence parfois noyée par les classements : un modèle est aussi une économie d'exécution. Un agent qui tourne trente secondes et un agent qui tourne trois heures ne consomment pas le même produit, même s'ils commencent avec le même prompt.

Et c'est ici qu'arrive le fameux “DeepSeek Harness”.

“DeepSeek Harness” : oui, il existe une équipe. Non, je ne trouve pas de produit officiel sorti

DeepSeek recrute actuellement une Agent Harness Team, à côté de postes Agent Infra et Code Agent Data. C'est visible sur son propre site de recrutement.6 Le signal est intéressant : le laboratoire considère assez explicitement le harness comme une discipline séparée de l'entraînement du modèle.

Mais ce n'est pas la même chose qu'un produit nommé “DeepSeek Harness” disponible au téléchargement.

Les docs publiques de DeepSeek font aujourd'hui surtout l'inverse : elles expliquent comment brancher V4 sur Claude Code, OpenCode, OpenClaw, Pi, WorkBuddy, Deep Code et d'autres agents tiers.7 Dans le cas de Pi, DeepSeek le décrit même comme un “terminal coding harness” tiers. Le modèle est le backend ; le harness peut venir d'ailleurs.

Page de recrutement DeepSeek où apparaît l’équipe Agent Harness
La page de recrutement de DeepSeek sépare bien « Agent Harness » et « Agent Infra ». C’est un signal d’organisation, pas encore l’annonce d’un produit public autonome.DeepSeek

Cette distinction évite une confusion assez fréquente dans les flux d'actualité IA : une capture d'une offre d'emploi devient un “DeepSeek prépare son Claude Code”, puis deux reposts plus tard, le futur outil est raconté comme s'il était déjà disponible. Ici, l'information vérifiable est plus modeste et plus intéressante : DeepSeek investit dans une couche harness, mais continue pour l'instant à traiter l'écosystème d'agents existants comme la voie publique d'utilisation de V4.

Meta fait exactement l'inverse : modèle et harness sont entraînés ensemble

Le 5 août, Meta lance Muse Code en beta avec Muse Spark 1.2. C'est probablement la sortie qui illustre le mieux la thèse de cette quinzaine, parce que Meta dit avoir entraîné le modèle et le coding agent ensemble.8

Muse Code sait planifier des modifications, écrire du code, vérifier le résultat et lancer plusieurs sous-agents en parallèle. Il garde aussi un journal persistant de ses actions, ce qui lui permet de reprendre après un crash au lieu de recommencer sans mémoire.8

Ce dernier détail paraît banal jusqu'à ce qu'on le retire. Un excellent modèle sans état fiable peut perdre le fil d'une tâche longue. Un modèle un peu moins fort, mais placé dans un système qui garde les décisions, isole le travail des sous-agents, vérifie les résultats et sait reprendre, peut produire une expérience beaucoup plus utile.

Page officielle de Meta consacrée à la famille Muse Spark
Muse Spark 1.1 précédait de quelques semaines Spark 1.2. Meta décrit déjà la famille comme conçue pour l’agentique, l’orchestration et le code.Meta

Le 10 août, Meta complète le tableau avec Muse Glimmer, un modèle ouvert plus compact pensé pour des tâches agentiques exécutables sur une seule carte graphique grand public.9 Le positionnement est différent de Spark : au lieu de demander à chaque tâche de monter au modèle principal, Meta recrée une hiérarchie. Le gros modèle peut servir aux problèmes difficiles ; un petit modèle distillé peut absorber les tâches ordinaires.

C'est exactement le problème que les routeurs cherchent à résoudre automatiquement.

Nvidia sort un modèle et, presque plus intéressant, le routeur qui décide quand l'utiliser

Le 11 août, Nvidia lance Nemotron 3.5 Lightning, modèle ouvert destiné à des tâches comme la revue de code, l'usage d'outils, le tri d'alertes de sécurité ou des questions opérationnelles. Le même jour, Nvidia publie NeMo Switchyard, une bibliothèque open source de routage entre modèles.10

Le duo est plus révélateur que chaque annonce prise séparément. Switchyard part de l'idée qu'un agent n'a aucune raison d'utiliser systématiquement le modèle le plus puissant et le plus cher. Selon la tâche, il peut choisir un petit modèle rapide, un modèle spécialisé ou un frontier model.

Dépôt officiel NVIDIA NeMo Switchyard présentant le routeur de trafic entre modèles
Switchyard rend le routage explicite : un même agent peut conserver son API tout en faisant passer les requêtes vers plusieurs modèles ou fournisseurs.NVIDIA-NeMo / GitHub

Cette logique rend la question “quel est le meilleur modèle ?” de moins en moins suffisante. Pour une entreprise ou un développeur, une question plus utile peut devenir : quel mélange de modèles et quel harness terminent le travail avec le moins de coût, de latence et d'interventions humaines ?

Le modèle est toujours déterminant. Mais il ressemble de plus en plus au moteur d'une voiture : crucial, coûteux, différenciant, et pourtant incapable de décrire à lui seul le comportement de l'ensemble.

Grok 4.6 : la performance est maintenant vendue avec la durée

Le 12 août, SpaceXAI lance Grok 4.6. Le positionnement rapporté au lancement insiste sur les tâches complexes et les agents capables de travailler longtemps. Artificial Analysis le place environ cinq points au-dessus de Grok 4.5 sur son Intelligence Index, avec un niveau proche de GPT-5.6 Sol et derrière les meilleurs modèles Anthropic au moment du test.11

Là encore, la trajectoire du produit compte autant que le score. Un mois plus tôt, xAI avait ouvert le code de Grok Build, son agent de code et son TUI. Le dépôt expose précisément ce que recouvre un harness : assemblage du contexte, parsing des réponses, dispatch des appels outils, lecture et modification des fichiers, commandes, système de plugins, hooks, MCP et sous-agents.12

Visuel officiel de l’ouverture du code de Grok Build
Grok Build rend visible la couche autour du modèle : outils, contexte, commandes, extensions et sous-agents deviennent du logiciel inspectable.SpaceXAI

C'est une évolution utile pour toute l'industrie, y compris si l'on n'utilise jamais Grok. Quand un laboratoire publie son harness, on peut enfin distinguer ce qui vient du modèle de ce qui vient de la couche d'exécution. On peut reprendre une idée, remplacer le backend, mesurer les effets d'une stratégie de contexte ou comprendre pourquoi une démonstration marche mieux qu'une autre.

La transparence n'est pas complète pour autant. Un harness ouvert ne rend pas automatiquement les données d'entraînement, les poids du modèle ou les recettes de post-training publics. Mais il ouvre une boîte qui était longtemps restée invisible dans les comparaisons d'agents.

Gemini 3.7 Flash : le “petit” modèle devient celui qu'on laisse travailler

Google arrive le 13 août avec Gemini 3.7 Flash, orienté code et automatisation de workflows. Le mot Flash suggère toujours la vitesse, mais l'évolution la plus intéressante des modèles rapides est qu'ils ne servent plus seulement à répondre vite. Ils sont utilisés comme workers dans des boucles qui font plusieurs actions.13

C'est une transformation économique autant que technique. Quand un agent doit lire cinquante fichiers, appeler dix outils, se tromper deux fois puis vérifier son patch, le coût de chaque étape devient important. Un modèle légèrement moins performant à chaque appel peut gagner au niveau du système s'il est beaucoup moins cher, suffisamment fiable et correctement entouré.

Visuel officiel Google DeepMind représentant la famille Gemini Flash
Le positionnement Flash est devenu celui du worker rapide : un modèle pensé pour être appelé de nombreuses fois dans des workflows agentiques.Google DeepMind

Cette architecture multi-rôles existait déjà dans des systèmes de recherche. Ce qui change en 2026 est sa banalisation dans les produits grand public et les outils de développement. L'utilisateur choisit parfois encore un modèle dans un menu, mais le produit peut en réalité lancer plusieurs appels, plusieurs rôles et plusieurs contextes derrière ce choix unique.

GLM-5.3 : la nouvelle la plus intéressante est qu'il n'est pas encore vraiment sorti

Le 14 août, Z.ai présente GLM-5.3 avec une communication centrée sur le code et la cybersécurité. Z.ai dit obtenir 84,5 % sur CyberGym pour l'identification de vulnérabilités, légèrement au-dessus du score qu'il attribue au Mythos 5 d'Anthropic, mais reste nettement derrière ce dernier sur ExploitBench, qui mesure le passage de la vulnérabilité à un exploit fonctionnel. Reuters précise que ces résultats n'ont pas été vérifiés indépendamment.14

Surtout, Z.ai annonce qu'il ne publiera pas immédiatement les poids. Le laboratoire prévoit environ deux semaines d'évaluations de sécurité supplémentaires et un mécanisme d'accès vérifié pour les fonctions cyber les plus sensibles.14

Cela mérite d'être marqué dans un roundup parce que notre cerveau transforme très vite “présenté vendredi” en “sorti vendredi”. Pour GLM-5.3, la distinction est précisément une partie de l'histoire. Un laboratoire chinois connu pour les poids ouverts retarde volontairement une ouverture en invoquant le niveau de capacité cyber. C'est à la fois un signal de performance revendiquée et un changement de procédure de publication.

Freebuff : pas une sortie des deux dernières semaines, mais un bon thermomètre

Freebuff circulait beaucoup récemment, mais le calendrier est moins excitant que les reposts. Le CLI Freebuff a été lancé le 12 février 2026. Son billet de lancement a été mis à jour le 22 juillet. Le produit se présente comme un agent de code gratuit qui choisit des modèles open weight et évite l'abonnement fixe.17 Une version Desktop est aujourd'hui disponible en beta sur macOS, Windows et Linux.18

Donc non, Freebuff n'est pas “le nouveau harness sorti cette semaine”. Il reste pertinent dans cet article pour une autre raison : il incarne une couche agent qui veut devenir indépendante de la marque du modèle.

Visuel officiel Freebuff présentant son agent de code gratuit
Freebuff n’est pas une sortie de cette quinzaine : son CLI date de février. Il montre en revanche très bien l’idée d’un harness qui peut changer de modèle derrière une expérience stable.Freebuff

Le modèle peut alors être remplacé quand un autre devient meilleur ou moins cher. Pour l'utilisateur, la fidélité se déplace du modèle vers le harness, ses permissions, son interface, son historique et sa façon de travailler. C'est un renversement assez profond : il y a encore un an, beaucoup d'outils se vendaient surtout comme “le meilleur endroit pour utiliser Claude”. Aujourd'hui, un produit peut essayer de posséder la boucle et traiter le modèle comme une pièce interchangeable.

Les benchmarks commencent enfin à mesurer le couple modèle + harness

Cette évolution serait seulement sémantique si la couche harness ne changeait pas réellement les résultats. Les travaux de recherche récents commencent justement à isoler cet effet.

Harness-Bench évalue plusieurs configurations de harness sur plusieurs modèles, avec des tâches et budgets partagés. Sur 5 194 trajectoires, les auteurs observent des écarts substantiels de complétion, qualité de processus, efficacité et types d'échec selon le couple modèle-harness. Leur conclusion opérationnelle est simple : attribuer toute la performance au modèle masque une partie du système.16

Le 12 août, Harness-IF ajoute une autre pièce. L'étude teste 12 modèles frontier et place des règles d'instruction sur cinq surfaces différentes qu'un coding agent peut lire. Les scores d'obéissance changent selon que la règle est dans le prompt système, le fichier projet, l'instruction utilisateur, la description d'outil ou la description de skill. Les auteurs montrent aussi que les modèles sont moins fiables quand une règle va contre leur comportement spontané.15

Schéma du pipeline d’évaluation Harness-Bench
Harness-Bench compare les couples modèle-harness dans des environnements, budgets et validateurs communs, au lieu d’attribuer tout le résultat au modèle.Yao et al. / arXiv

C'est exactement la raison pour laquelle deux captures de SWE-bench peuvent sembler contradictoires sans que personne mente nécessairement. Le modèle peut être le même, mais pas le scaffold, pas le budget de tokens, pas les outils, pas la stratégie de retry, pas le contexte initial, pas le vérificateur.

L'industrie a longtemps comparé des moteurs montés dans des voitures différentes en affichant seulement le nom du moteur. Elle commence à mesurer le véhicule.

Ce que racontent vraiment ces quinze jours

Si on réduit la période à une liste, on obtient beaucoup de noms et très peu d'information : Qwen3.8-Max, DeepSeek V4-Flash puis V4 Pro, Muse Spark 1.2, Muse Code, Muse Glimmer, Nemotron 3.5 Lightning, Grok 4.6, Gemini 3.7 Flash, GLM-5.3. C'est le genre de liste qui vieillit avant la fin du café.

Le fil conducteur tient mieux.

Premièrement, les modèles rapides et peu chers deviennent des composants d'agents, pas seulement des chatbots moins bons. DeepSeek V4-Flash, Muse Glimmer, Nemotron Lightning et Gemini Flash ont de la valeur parce qu'une boucle agentique fait beaucoup d'appels et que l'économie de chaque appel s'additionne.

Deuxièmement, les laboratoires internalisent le harness. Meta co-entraîne Muse Spark 1.2 avec Muse Code. SpaceXAI publie Grok Build. Alibaba documente des Harness tools. DeepSeek recrute une équipe Agent Harness. Nvidia livre un routeur de modèles avec son nouveau modèle.

Page du papier Harness-IF consacré au suivi d’instructions dans les coding agents
Harness-IF, publié le 12 août, mesure comment l’emplacement d’une règle dans le harness change son respect par le modèle.Huang et al. / arXiv

Troisièmement, “open” se fragmente. On peut ouvrir les poids mais imposer des clauses commerciales. On peut ouvrir le harness mais garder le modèle fermé. On peut retarder les poids pour des raisons de sécurité. On peut proposer un harness gratuit qui commute entre modèles ouverts. Dire simplement “open source” ne suffit plus à décrire ce que l'on peut réellement inspecter, modifier, héberger et vendre.

Quatrièmement, la durée devient une métrique produit. Les annonces de Grok 4.6, Muse Code ou des modèles dits agentiques insistent moins sur la qualité d'une réponse unique que sur la capacité à rester utile au fil d'une tâche longue. Ça déplace le problème : mémoire, reprise après crash, worktrees, permissions, budgets, sous-agents et vérification cessent d'être du plumbing. Ce sont des fonctions centrales.

Cela ne signifie pas que les modèles sont devenus interchangeables. Grok 4.6, Qwen3.8, V4 Pro ou un futur GLM n'ont pas les mêmes forces. Un harness ne transforme pas magiquement un modèle faible en modèle frontier. Les études montrent d'ailleurs que certaines tâches restent au-delà de ce que la couche d'exécution peut récupérer.

Mais le mouvement est clair : nous entrons dans une période où demander “quel modèle utilises-tu ?” ressemble de plus en plus à demander uniquement quel processeur se trouve dans une machine. C'est encore une information importante. Elle ne suffit simplement plus.

Pour comprendre ce qu'un agent peut réellement faire, il faut demander la suite : quel harness ? Quels outils ? Quel contexte ? Quelle politique de permissions ? Quel routeur ? Quel vérificateur ? Quel prix quand la tâche dure deux heures ? Est-ce que le système reprend après un crash ? Est-ce que les poids sont ouverts, le harness est ouvert, les deux, ou aucun ?

Les quinze derniers jours n'ont pas seulement ajouté une poignée de modèles au menu. Ils ont rendu la carte derrière le menu beaucoup plus visible.