Un nouveau Kimi K3 benchmark publié par Artificial Analysis vient confirmer la montée en puissance du modèle ouvert de Moonshot AI : sur l’AA-Briefcase, son test maison dédié au travail agentique complexe, Kimi K3 se classe deuxième, juste derrière Claude Fable 5 d’Anthropic. Une étude parallèle de Fireworks AI, publiée le 21 juillet 2026, ajoute un angle pratique : combiner les deux modèles via un routage intelligent produit de meilleurs résultats que chacun pris isolément.
Un score serré face à Claude Fable 5
AA-Briefcase évalue les modèles sur un jeu de données privé de tâches réalistes — production de tableurs, de présentations, de maquettes d’interface — notées selon un score Elo qui combine exactitude, qualité analytique et qualité de présentation. Kimi K3, modèle à 2 800 milliards de paramètres, y obtient un score de 1 543, en progression de 727 points par rapport à la génération précédente Kimi K2.6.
Ce résultat le place juste derrière Claude Fable 5, en tête avec 1 574 points, et devant GPT-5.6 Sol (1 501). Fait notable : Kimi K3 devance nettement Claude Sonnet 5 (1 388) et Claude Opus 4.8 (1 347), deux autres modèles de la gamme Anthropic. Sur le taux de réussite des critères de notation, Kimi K3 atteint 51 %, contre 56 % pour Fable 5, et affiche même une qualité analytique quasi identique (1 754 contre 1 744). Son point faible reste la qualité de présentation (1 471) et la lenteur : chaque tâche lui prend en moyenne 56,4 minutes, environ 2,5 fois plus de temps qu’à Fable 5, pour un coût moyen de 10,57 dollars par tâche.
Router plutôt que choisir un seul modèle
C’est là que l’étude de Fireworks AI apporte un éclairage complémentaire. En testant Kimi K3 et Claude Fable 5 sur environ 1 030 tâches agentiques réelles — correction de bugs sur de vrais dépôts de code, opérations terminal en sécurité et administration système, problèmes algorithmiques, implémentation multilingue et tâches juridiques notées par des avocats — Fireworks montre qu’un routeur qui bascule intelligemment entre les deux modèles atteint 93 % de précision, un nouveau record qui dépasse chacun des deux modèles utilisé seul.
Le gain n’est pas que qualitatif : ce routage se révèle jusqu’à 50 fois moins coûteux que d’utiliser Fable 5 seul sur de longues boucles agentiques. Kimi K3 excelle particulièrement sur le terminal, les mathématiques symboliques et les outils de développement, tandis que Fable 5 garde l’avantage sur le web, la visualisation de données et la diversité des langues. Le routage dit « oracle » — qui simule le choix théorique optimal — sélectionne d’ailleurs Kimi K3 pour 72 à 96 % des tâches selon les catégories, un signe que l’écart de qualité entre modèle ouvert et modèle fermé continue de se resserrer.
Ce résultat confirme une tendance déjà observée sur les comparatifs entre Kimi K3, DeepSeek V4 Pro et GLM-5.2 : les modèles ouverts chinois ne se contentent plus de rattraper leur retard sur des benchmarks généraux, ils deviennent compétitifs sur des tâches agentiques complexes et coûteuses à exécuter à grande échelle.
Qu’est-ce que l’AA-Briefcase, le benchmark utilisé pour Kimi K3 ?
AA-Briefcase est un benchmark maison d’Artificial Analysis qui évalue les modèles sur des tâches réalistes de travail agentique (tableurs, présentations, maquettes), notées selon un score Elo combinant exactitude, qualité analytique et qualité de présentation.
Kimi K3 est-il meilleur que Claude Fable 5 ?
Non, Kimi K3 arrive deuxième sur l’AA-Briefcase avec 1 543 points contre 1 574 pour Claude Fable 5, qui reste en tête. Mais l’écart se resserre nettement par rapport aux générations précédentes de modèles ouverts.
Pourquoi router entre Kimi K3 et Fable 5 plutôt que choisir un seul modèle ?
Selon Fireworks AI, un routage intelligent entre les deux modèles atteint 93 % de précision sur environ 1 030 tâches agentiques, un résultat supérieur à chaque modèle pris seul, avec un coût jusqu’à 50 fois inférieur à l’usage exclusif de Fable 5.
