OpenClaw a lancé la mode des agents IA autonomes open source. Depuis, Hermes de Nous Research, ZeroClaw, PicoClaw et même Microsoft s’y engouffrent. Tour d’horizon d’un écosystème en pleine effervescence.
Browsing: Analyse
Un nouveau benchmark AA-Briefcase place Kimi K3 juste derrière Claude Fable 5 sur les tâches agentiques. Une étude Fireworks AI montre en plus qu’associer les deux modèles bat les deux pris séparément.
Une étude d’Epoch AI montre que Pangram, GPTZero et Originality.ai laissent passer jusqu’à 48 % des textes IA quand un modèle imite le style d’un auteur.
Le benchmark RadLE 2.0 montre que les modèles d’IA en radiologie progressent vite, mais peinent encore à reconnaître leurs propres erreurs face aux radiologues humains.
Kimi K3, DeepSeek V4 Pro et GLM-5.2 comparés sur les benchmarks, les licences et le coût réel de déploiement en API — un écart de coût qui va de 1 à 23 selon les usages.
Xi Jinping annonce la création d’une organisation mondiale de gouvernance de l’IA sans les pays occidentaux, avec 5 000 places de formation pour les pays du Sud et des centres de coopération auprès de l’ASEAN, de l’Union africaine et des BRICS.
Google préparerait Gemini Live et un menu Skills natif pour le web, selon TestingCatalog. L’occasion de comparer le support du Model Context Protocol chez Claude, ChatGPT et Qwen sur macOS — ce dernier l’offrant gratuitement.
Comment les logiciels ATS trient les candidatures par mots-clés plutôt que par compétences réelles : histoire du recrutement automatisé, études chiffrées, procès Amazon et Workday, et flou de l’AI Act européen.
Les valeurs de Claude varient selon la langue : une étude Anthropic sur plus de 300 000 conversations révèle plus de chaleur en hindi, plus de rigueur en russe et d’autres écarts culturels marqués.
Gemini dans Chrome s’étend au Royaume-Uni, mais la France et l’Union européenne restent exclues, sans explication officielle de Google sur ce retard persistant.
