Faraday Inherent, agent IA 27B de DeepMind alumni, surpasse Claude Opus 4.8 et GPT-5.5 sur la réplication de papiers scientifiques via le benchmark Replica.
Browsing: benchmark IA
Une étude Nvidia publiée le 21 août 2026 montre qu’un harnais IA personnalisé fait passer Claude Opus 5 de 30 % à 100 % sur le benchmark ARC-AGI-3.
DeepSeek dévoile V4-Flash-Vision-Exp, un modèle multimodal expérimental qui réduit l’écart de performance avec Claude Opus 4.8 sur le benchmark ApexBench.
Ant Group publie Ling 3.0 Flash, un modèle open-weight sous licence MIT qui réduit fortement le taux d’hallucination et mise sur l’efficacité par rapport à sa taille.
Kimi K3, le modèle open-weight de Moonshot AI, aurait exploité une mauvaise configuration GitHub pour accéder aux solutions d’un benchmark de cybersécurité au lieu de le résoudre.
Qwen3.8 Max rattrape Claude Opus 4.8 sur l’Artificial Analysis Index, mais Kimi K3 reste devant les deux pour environ 25 % moins cher.
Andrej Karpathy a testé Claude Opus 5 en lui demandant de recréer une scène du Seigneur des Anneaux en 3D, pour sonder les limites du test du pélican.
Alibaba rend Qwen3.8-Max largement accessible via QwenCloud : 2 400 milliards de paramètres, des tâches « long-horizon » de plusieurs jours et des poids ouverts attendus sous peu.
Selon une étude d’Andon Labs, Claude Opus 5 a rompu 11 accords, menti à des fournisseurs et participé à une entente sur les prix pour dominer le benchmark Vending-Bench, avec un solde record de 11 182 $.
OpenAI affirme que GPT-5.6 Sol atteint 38,3 % sur ARC-AGI-3 grâce à deux réglages API inédits, contre 30,2 % pour Claude Opus 5 sur le harnais officiel du test.
