Devin Fusion, c'est un mode de l'agent de code Devin (Cognition) qui confie la réflexion à un modèle frontière cher et l'exécution à un modèle moins cher, pour consommer moins de tokens à qualité proche. Je l'ai testé sur un vrai projet : l'idée est bonne, le suivi de ce que fait l'agent est excellent, mais c'est lent et l'économie reste à confirmer sur de grosses tâches.
« Je brûle des tokens comme jamais. »
C'est ce que je me suis dit en regardant mes derniers projets. Que ce soit chez Anthropic ou chez OpenAI, la facture monte vite. Fable 5.1, en particulier, est un vrai carboniseur de tokens.
Dans la vidéo ci-dessus, je teste donc une autre manière de coder : les modèles « fusion ». Voici ce que j'ai vu, sans enjoliver.
Devin Fusion, c'est quoi exactement ?
Devin est l'agent de développement de Cognition, présenté comme un « AI software engineer ». Fusion est un mode de fonctionnement de cet agent.
Cognition l'a annoncé fin juin 2026, puis l'a étendu à Devin Desktop et à la ligne de commande le 11 septembre 2026. C'est cette version que je teste.
Le principe tient en une phrase : un seul modèle ne fait plus tout le travail.
- Un modèle lead (le « lead frontière ») reçoit ta demande, analyse le code et planifie.
- Un modèle sidekick, moins cher, exécute : écriture du code, des tests, correction du lint, préparation de la pull request.
- Le lead revient à chaque étape importante pour vérifier, valider et autoriser (ou pas) les modifications.
C'est ce qu'on appelle du model routing. Et c'est surtout une question de harness : le système autour du modèle, qui route les demandes, contrôle les résultats et décide qui fait quoi.
Le problème n'a jamais été la puissance des modèles. Le problème, c'est qu'on utilise le modèle le plus cher pour des tâches qui n'en ont pas besoin.
Ce que Cognition annonce
Selon le billet de Cognition du 11 septembre :
- le duo recommandé est Fable 5.1 en lead + SWE-2 en sidekick ;
- le duo GPT-6 Astra + SWE-2 a aussi été mesuré ;
- Cognition annonce 36 % de coût en moins pour Fable 5.1 + SWE-2 face à Claude Code seul, et 39 % de moins pour Astra + SWE-2 face à Codex seul ;
- selon les benchmarks (DeepSWE, Terminal-Bench, SWE-Atlas), l'économie va de 11 % à 46 %.
Ce sont les chiffres de l'éditeur. Les benchmarks, c'est bien beau. Moi, j'aime tester directement.
Mon test en conditions réelles
La configuration
Fusion n'est disponible que sur l'offre Pro. Je suis donc passé en Pro pour le test : 20 dollars par mois au moment du tournage (voir la page tarifs de Devin).
Ensuite :
- Nouvelle session dans l'agent local Devin, sur un dossier de projet existant.
- Activation du mode Fusion.
- Choix du lead : on peut sélectionner Fable 5.1, j'ai pris GPT-6 Astra cette fois.
- Sidekick en niveau medium.
Le prompt était volontairement simple :
Analyse la codebase. Écris les tests unitaires. Fais-moi un feedback sur la consommation de tokens.
Le projet était déjà bien avancé, avec pas mal de tests unitaires. Devin a identifié tout seul la lacune la plus utile à combler : les cas limites de la partie analyse IA.
Ce que j'ai trouvé bien
La lisibilité. Devin affiche les fichiers modifiés et les commandes exécutées, au fil de l'eau. On voit concrètement ce qu'il fait. J'ai l'impression de le voir de moins en moins chez Codex et chez Claude, et ça m'a manqué.
Le choix des modèles. Dans les réglages Fusion, on a accès à pas mal de modèles, dont certains gratuits comme GLM. On pourrait donc confier les tâches classiques à un sidekick qui ne coûte presque rien.
Les modes de travail. Code, Smart, Ask, Plan, Bypass permissions. J'aurais dû lancer directement en bypass, je l'ai fait ensuite et ça marche plutôt bien.
L'écosystème. On peut brancher des skills, des hooks, connecter à peu près tout ce qu'on veut.
Le cache visible. L'interface affiche le contexte consommé et un cache de prompt qui expire (« expire dans 3 minutes »). Un détail, mais utile pour comprendre ce qu'on paie.
Le natif. Sur Claude Code, on pouvait déjà bricoler des routeurs entre modèles. Mais c'était un peu tiré par les cheveux. Ici, c'est intégré dans le harness.
Ce qui coince
La vitesse. On ne peut pas tout avoir : le prix et la rapidité. Après plus d'une dizaine de minutes, l'agent était encore en train de finaliser. Pour une tâche de tests unitaires, c'est lent.
Le compteur de coût. À la fin, Devin m'a annoncé 20 tests unitaires ajoutés (sur l'analyse IA, le stockage et le client HTTP). Mais quand je lui ai demandé la conso, sa réponse a été honnête : il n'avait pas accès au compteur facturé de la session, et il ne voulait pas inventer.
J'ai donc fouillé moi-même dans les commandes d'usage.
Les chiffres que j'ai pu lire
Voici ce que les écrans de la session affichaient, tel quel :
- modèle de base : GPT-6 Astra, en niveau medium ;
- 22 messages dans la session ;
- environ 33 000 tokens pour le prompt système ;
- environ 84 000 tokens sur GPT-6 Astra et environ 55 000 tokens sur l'autre poste de la session ;
- un indicateur d'environ 21 % des tokens associé au sidekick medium ;
- une estimation « fusion » d'environ 48 % d'économie, calculée par l'outil lui-même.
Ma lecture : si tout avait tourné sur un seul modèle frontière, on aurait consommé l'addition, autour de 130 000 tokens, au prix fort.
Je reste prudent. Cette comparaison n'est pas vraiment vérifiable, parce que GPT-6 Astra est justement conçu pour produire beaucoup moins de tokens en sortie. Un seul modèle n'aurait donc pas forcément consommé la somme des deux.
Tableau récapitulatif du test
| Critère | Ce que j'ai observé |
|---|---|
| Accès | Offre Pro obligatoire (20 dollars par mois lors du test) |
| Configuration testée | Lead GPT-6 Astra, sidekick medium |
| Tâche | Analyse de codebase et ajout de tests unitaires |
| Résultat | 20 tests unitaires ajoutés, ciblés sur les cas limites |
| Durée | Plus de 10 minutes, lent |
| Transparence | Excellente : fichiers modifiés et commandes visibles |
| Coût réel facturé | Non affiché dans la session |
| Économie estimée par l'outil | Environ 48 %, à confirmer |
| Chiffre éditeur | 36 % à 39 % selon le duo, 11 % à 46 % selon les benchmarks |
Pourquoi c'est pertinent si tu codes avec l'IA
Si tu utilises Fable 5 ou Fable 5.1 au quotidien, tu le sais : la vitesse à laquelle ça brûle du token est incroyable.
C'est là que ce type d'architecture peut valoir le coup. Garder le modèle le plus intelligent pour ce qui demande du jugement (comprendre la demande, planifier, relire, valider), et laisser un modèle moins cher taper le code répétitif.
C'est exactement la logique qu'on applique en entreprise avec les humains. On ne fait pas relire chaque ligne par le directeur technique. On lui demande de valider l'architecture et la pull request.
Pour comparer les deux modèles leads en profondeur, j'ai publié un test complet : GPT-6 Astra vs Fable 5.1. Et si tu cherches des alternatives moins chères, regarde aussi mon test de DeepSeek 4.1 Flash.
Même logique côté organisation : quand j'accompagne une équipe dans une intégration de l'IA en entreprise, la question du coût par tâche arrive toujours. Le bon modèle au bon endroit, c'est souvent là que se joue la rentabilité.
Mon avis
L'idée est très bonne. L'IDE de Cognition est vraiment bien fait, franchement stylé et très orienté développeur, au niveau de ce qu'on a sur ChatGPT ou Claude.
Mais un test sur une tâche de tests unitaires ne suffit pas à trancher sur l'économie réelle. Pour savoir si on gagne énormément sur la consommation, il faut le lancer sur de grosses tâches et le suivre dans la durée.
Je continue à le tester, et je ferai une vidéo de suivi pour confirmer (ou pas) les économies.
En attendant, si tu travailles surtout avec Claude, les bons réflexes pour maîtriser ta conso restent les mêmes : cadrer tes demandes, découper les tâches, et ne pas lancer le modèle le plus cher pour tout. C'est ce que je détaille dans ma formation Claude Code, de débutant à expert.
FAQ
Qu'est-ce que Devin Fusion ?
C'est un mode de l'agent de code Devin, développé par Cognition. Un modèle frontière (le lead) planifie et valide, pendant qu'un modèle moins cher (le sidekick) exécute l'essentiel du travail : code, tests, lint, pull request. L'objectif est de réduire la consommation de tokens sans perdre en qualité.
Devin Fusion est-il gratuit ?
Non. Lors de mon test, le mode Fusion n'était accessible qu'avec l'offre Pro, à 20 dollars par mois. En revanche, certains modèles gratuits comme GLM étaient proposés comme sidekick.
Quels modèles peut-on utiliser avec Fusion ?
Cognition recommande Fable 5.1 en lead avec SWE-2 en sidekick, et a aussi mesuré GPT-6 Astra avec SWE-2. Dans mon test, j'ai choisi GPT-6 Astra en lead et un sidekick en niveau medium.
Combien de tokens économise-t-on vraiment ?
Cognition annonce entre 36 % et 39 % d'économie selon le duo, et de 11 % à 46 % selon les benchmarks. Dans ma session, l'outil estimait environ 48 %, mais le coût réellement facturé n'était pas affiché. Je ne le considère donc pas comme un chiffre établi.
Devin Fusion est-il plus lent qu'un agent classique ?
Dans mon test, oui. La tâche (analyse de la codebase et ajout de tests unitaires) a pris plus d'une dizaine de minutes. C'est le compromis : on gagne potentiellement sur le prix, on perd en rapidité.
Peut-on faire la même chose avec Claude Code ?
On peut mettre en place des routeurs entre modèles autour de Claude Code, mais ça demande du bricolage. L'intérêt de Fusion, c'est que le routage est natif dans le harness de Devin.
Conclusion
Devin Fusion ne va pas diviser ta facture par deux du jour au lendemain. Mais il pose la bonne question : pourquoi payer le modèle le plus cher pour écrire du code qu'un modèle plus simple sait écrire ?
La prochaine étape, c'est de le tester sur des projets lourds. Je le ferai en vidéo.
Pour ne pas la rater, abonne-toi à la chaîne YouTube @SophieneIA.
Et si tu veux apprendre à piloter Claude sans brûler ton budget, tout est dans Maîtrise Claude. Tu préfères en parler directement pour ton projet ou ton équipe ? Réserve un appel.