Cursor vient de publier les résultats d’une expérience qui bouscule une idée reçue sur le codage par IA : un essaim d’agents combinant un modèle frontière pour planifier et des modèles bon marché pour exécuter peut surpasser un modèle unique haut de gamme travaillant seul, pour une fraction du coût. L’éditeur de l’IDE Cursor a rendu public le code de l’expérience sur GitHub.

Reconstruire SQLite en Rust, sans filet

Le test choisi est volontairement exigeant : reconstruire le moteur de base de données SQLite en Rust, en ne s’appuyant que sur la documentation, sans accès au code source original ni à internet pendant la génération. Cursor a comparé deux approches sur cette tâche : un modèle unique travaillant seul (GPT-5.5), et une architecture en essaim où un modèle planificateur (Claude Opus 4.8) découpe le travail et distribue les tâches à des modèles « workers » moins chers (Composer 2.5 et Claude Fable 5).

Résultat : la configuration en essaim a atteint 100 % de réussite sur la suite de tests, quand l’ancienne approche donnait des résultats instables. Le code complet de l’expérience, y compris la configuration utilisée pour la version « Opus seul », est disponible sur le dépôt GitHub minisqlite.

Un écart de coût qui change la donne

Le chiffre qui retient l’attention est celui du coût total : la version en essaim (Opus en planificateur, Composer en exécutant) est revenue à 1 339 dollars, contre 10 565 dollars pour GPT-5.5 utilisé seul sur la même tâche. Sur la seule partie exécution du travail, l’écart est similaire : 411 dollars pour la combinaison Opus/Composer contre 9 373 dollars pour GPT-5.5 solo.

Le nombre de conflits de fusion générés pendant le processus illustre aussi la différence de méthode : moins de 1 000 conflits pour la nouvelle architecture, contre plus de 70 000 pour l’ancienne. Le code final produit par l’essaim est également beaucoup plus compact, avec une réduction de la base de code allant jusqu’à 85 % (9 908 lignes contre 64 305 lignes pour l’approche à modèle unique).

Le principe : un cerveau qui planifie, des mains qui exécutent

L’idée défendue par Cursor n’est pas de remplacer les modèles frontière, mais de réserver leur usage — plus coûteux — aux tâches qui demandent réellement du raisonnement complexe : découper un projet, définir l’architecture, arbitrer entre plusieurs approches. Les modèles moins chers prennent ensuite le relais pour l’exécution mécanique : écrire le code proprement dit, tâche par tâche, sous la supervision du planificateur.

Pour les équipes qui utilisent des agents de codage IA au quotidien, l’expérience de Cursor suggère une piste concrète pour réduire la facture sans sacrifier la qualité : ce n’est pas le modèle le plus puissant qui doit tout faire, mais celui qui sait le mieux organiser le travail des autres.

Qu’est-ce que l’architecture en essaim de Cursor ?

C’est une méthode où un modèle IA frontière (comme Claude Opus 4.8) planifie et découpe une tâche de codage complexe, tandis que des modèles moins chers (comme Composer 2.5 ou Claude Fable 5) exécutent les tâches individuelles sous sa supervision.

Quelle économie permet cette approche selon Cursor ?

Sur l’expérience de reconstruction de SQLite en Rust, la configuration en essaim a coûté 1 339 dollars contre 10 565 dollars pour GPT-5.5 utilisé seul sur la même tâche, tout en atteignant 100 % de réussite sur la suite de tests.

Où trouver le code de cette expérience ?

Cursor a publié le code complet de l’expérience, dont la configuration Opus utilisée seule, sur le dépôt GitHub public appelé minisqlite.

Share.
Exit mobile version