Anthropic lance Claude Opus 5.5, qu'elle dit au niveau de Claude Fable 5.1 pour un coût d'usage inférieur de 40 % à celui d'Opus 5
Claude Opus 5.5, premier modèle de la nouvelle famille Claude 5.5, est sorti le 22 septembre, deux mois après Opus 5, lancé le 24 juillet selon TechCrunch. Anthropic affirme qu'il atteint le niveau de Claude Fable 5.1 « sur la plupart des tâches » et qu'il coûte 40 % de moins à faire tourner qu'Opus 5. Ce pourcentage combine deux effets, précise The Decoder : le prix des jetons et le nombre de jetons consommés. Le tarif seul baisse de 20 %, à 4 dollars par million de jetons en entrée et 20 dollars en sortie, contre 5 et 25 dollars pour Opus 5 ; la lecture de cache, qui représente selon Anthropic l'essentiel du coût des travaux agentiques et de programmation, tombe à 0,20 dollar, soit 60 % de moins. Dans le tableau de l'éditeur, Opus 5.5 obtient 66,4 % sur Terminal-Bench 4.0, contre 57,9 % pour GPT-6 Astra d'OpenAI, les deux modèles étant mesurés à des réglages d'effort différents ; GPT-6 Astra reste devant sur Terminal-Bench-Science 0.1, avec 64,6 % contre 58,7 %. Anthropic prévient elle-même qu'à ce niveau de capacité les écarts de benchmark sont devenus un indicateur moins fiable des différences réelles et que, dans son propre usage, l'écart avec Fable 5.1 est plus étroit que ne le suggèrent les scores. Artificial Analysis, cité par The Decoder, mesure pour sa part 59,6 % sur Terminal-Bench 4.0, à égalité avec GPT-6 Astra, et place Opus 5.5 en tête de son indice d'intelligence avec 58 points à l'effort maximal, en relevant qu'il consomme alors environ 119 000 jetons de sortie par tâche, contre 73 000 pour Opus 5, 78 000 pour Fable 5.1 et 27 000 pour GPT-6 Astra. Des évaluateurs externes, dont METR et Frontier Design, ont testé le modèle avant sa sortie. Anthropic le juge comparable à Claude Mythos 5.1 en biologie et en cybersécurité et le déploie avec des garde-fous proches de ceux de Fable 5.1. Selon The Decoder, il est disponible sur la plateforme d'Anthropic ainsi que chez AWS, Google Cloud et Microsoft Azure ; Sonnet 5.5 et Haiku 5.5 doivent suivre « dans les prochaines semaines ».
Pourquoi c'est important
Seul le tarif est acquis pour qui règle ses appels à l'API : 20 % de moins par jeton d'entrée ou de sortie, 60 % de moins sur la lecture de cache, poste qui représente selon Anthropic la majorité de la facture des travaux agentiques et de programmation. Les 40 % d'économie annoncés supposent en plus que le modèle consomme moins de jetons, ce qui dépend du réglage d'effort. Or, à l'effort maximal, Artificial Analysis compte environ 119 000 jetons de sortie par tâche contre 73 000 pour Opus 5, et la baisse des tarifs n'y fait que maintenir le coût par tâche au niveau de celui d'Opus 5, sans le réduire, selon The Decoder. Le calcul se refait donc sur ses propres tâches, au réglage que l'on compte employer.
Source : Anthropic
Mesurer le coût réel d'un modèle d'IA sur ses propres tâches →Avec GPT-6 Sol et Luna, OpenAI divise au moins par deux ses prix, pour un niveau presque inchangé selon Artificial Analysis
Quatre-vingt-dix minutes après la sortie de Claude Opus 5.5, relève TechCrunch, OpenAI a lancé le 22 septembre GPT-6 Sol et GPT-6 Luna, deux modèles entraînés avec des méthodes proches de celles de GPT-6 Astra, qui reste selon l'entreprise son meilleur modèle dans tous les domaines. Sol vise les tâches complexes récurrentes, comme la revue de code ou l'analyse de données, et Luna les gros volumes de tâches bien délimitées, résumé ou extraction d'informations, résume The Decoder. En API, Sol coûte 2 dollars par million de jetons en entrée et 10 dollars en sortie, contre 4 et 20 dollars pour GPT-5.6 Sol ; Luna passe à 0,10 et 0,50 dollar, contre 0,20 et 1,20 dollar. OpenAI présente l'ensemble comme une baisse de 50 % par rapport au tarif qu'elle qualifie de « promotionnel » de GPT-5.6 ; sur la sortie de Luna, la baisse atteint en fait 58 %. Sur son évaluation interne de factualité, bâtie sur des conversations où des utilisateurs avaient signalé une erreur, Sol commettrait environ deux fois moins d'erreurs que son prédécesseur, selon OpenAI, qui précise que ces conversations ne sont pas représentatives d'un usage courant. Ses autres comparaisons opposent Sol à Claude Opus 5 et à Claude Fable 5 à des réglages d'effort différents, et l'entreprise reconnaît que son tableau AutomationBench sous-estime le coût de Claude Fable 5.1. Artificial Analysis, cité par The Decoder, voit l'indice d'intelligence de Sol passer de 47 à 48 points et celui de Luna rester à 37, avec des reculs sur GDPval-AA, un test de travail intellectuel sur ordinateur couvrant 44 domaines professionnels ; The Decoder juge que la sélection de benchmarks retenue par OpenAI semble taillée à son avantage. Les deux modèles sont disponibles en API et dans ChatGPT Work et Codex pour les abonnés Plus, Pro, Business, Enterprise et Edu ; les comptes Free et Go n'ont accès qu'à Luna, dans l'application de bureau, et aucun des deux n'est encore proposé dans le Chat. Le même jour, OpenAI a revu son cache de prompts, avec jusqu'à 90 % de remise sur les jetons d'entrée mis en cache et une fenêtre de réutilisation de 30 minutes pour les préfixes communs.
Pourquoi c'est important
Le gain se lit d'abord sur Luna, calibré pour les traitements en volume : une entreprise qui fait résumer ou trier des milliers de documents par jour paie désormais 0,50 dollar le million de jetons produits au lieu de 1,20, pour un indice d'intelligence resté à 37 selon Artificial Analysis. L'argument de fiabilité appelle plus de prudence. La division par deux des erreurs de Sol se mesure sur des conversations déjà signalées comme fautives, qu'OpenAI juge elle-même peu représentatives. Quant aux reculs relevés sur GDPval-AA, ils tiennent surtout, d'après l'examen rapporté par The Decoder, à une présentation moins soignée et à des résultats incomplets : les défauts qu'un utilisateur de bureau remarque en premier, et qui justifient de relire les livrables avant de les transmettre.
Source : OpenAI
Alibaba dévoile la puce Zhenwu V900 et vise plus de 20 GW de centres de données exploités par Alibaba Cloud en 2032
Alibaba vise une capacité mondiale de centres de données exploités par Alibaba Cloud supérieure à 20 GW d'ici à 2032, a annoncé son directeur général, Eddie Wu, à la conférence Apsara, qui se tient du 22 au 24 septembre à Hangzhou. Le communiqué ne donne pas la capacité actuelle, ce qui empêche de mesurer l'effort à fournir. Sa filiale de semi-conducteurs T-Head a présenté la puce d'IA Zhenwu V900, dotée de 216 Go de mémoire et d'une bande passante de 1 200 Go/s entre puces, qui offrirait trois fois les performances de la génération précédente, la Zhenwu M890 sortie en mai ; Eddie Wu l'a présentée comme la puce d'IA la plus puissante de Chine à ce jour, rapporte TheNextWeb. Sa production de masse et sa commercialisation sont prévues au premier trimestre 2027. Les puces Zhenwu équipent déjà plus de 650 clients, de l'automobile à la finance, selon le communiqué ; Bloomberg, cité par TheNextWeb, fait état de son côté de 560 000 unités livrées à plus de 400 clients externes. Côté modèles, Qwen 4 est en cours d'entraînement, et les générations Qwen 4.5 et Qwen 5 doivent atteindre, selon les projections du groupe, 5 000 à 10 000 milliards de paramètres. Alibaba affirme aussi qu'au terme d'un mois d'exécutions entièrement automatisées, Qwen3.8-Max a mené 33 cycles itératifs d'optimisation autonome de son entraînement et fait passer son score chez Artificial Analysis de 40 à 45 ; le communiqué ne précise pas la mesure visée, et aucune confirmation indépendante n'en a été trouvée. L'action Alibaba a progressé mardi à Hong Kong, d'environ 3 % selon CNBC ; Yahoo Finance fait état d'une clôture en hausse de 2 % et TheNextWeb d'une hausse de 5,1 %, à son plus haut du mois.
Pourquoi c'est important
Les deux annonces matérielles portent sur l'avenir : la puce ne doit entrer en production de masse qu'au premier trimestre 2027, et l'objectif de 20 GW vise 2032 sans capacité de départ publiée. Pour une entreprise qui choisit aujourd'hui un fournisseur de cloud, elles dessinent une trajectoire à moyen terme. Le passage le plus sensible est celui sur Qwen3.8-Max. L'auto-amélioration de l'IA figure parmi les catégories de risque dont OpenAI, dans un texte publié le même jour, veut faire examiner les tests par des évaluateurs indépendants ; ici, la seule source du résultat est le communiqué d'Alibaba.
Xiaomi publie en poids ouverts MiMo-V2.6-Pro, en tête des modèles ouverts sur l'indice d'Artificial Analysis
Xiaomi a mis en ligne le 22 septembre MiMo-V2.6-Pro, présenté comme son modèle phare, dont les poids sont téléchargeables sous licence MIT sur Hugging Face, aux côtés d'une version plus légère, MiMo-V2.6-Flash. Ce modèle à mélange d'experts compte 1 020 milliards de paramètres, dont 42 milliards sollicités à chaque requête, selon The Decoder. Xiaomi revendique 46,32 points sur l'indice composite d'Artificial Analysis et le titre de modèle open source le plus puissant du moment ; VentureBeat le situe à égalité avec Grok 4.7, le modèle propriétaire de xAI. L'accès par API coûte 0,435 dollar par million de jetons en entrée et 0,87 dollar en sortie, selon Xiaomi, qui annonce une fenêtre de contexte d'un million de jetons ; une tâche du test d'Artificial Analysis revient à environ 0,13 dollar, rapporte The Decoder. Xiaomi attribue le gain de performances de ce modèle à une phase d'apprentissage par renforcement élargie, menée en moins de six jours pour environ 2,62 millions de dollars sur la version Pro et 0,85 million sur Flash, d'après les chiffres repris par The Decoder. L'entreprise publie aussi en open source sa boîte à outils d'apprentissage par renforcement, avec environ 7 000 tâches assorties de correcteurs automatiques, selon le même média. The Decoder rapproche cette sortie d'un rapport publié le 10 septembre par Anthropic, qui y décrit une campagne de « distillation illicite » de Claude attribuée à Xiaomi : plus de 400 000 échanges envoyés à Claude par plus de 1 500 comptes, via des services intermédiaires, en vingt jours, en mars et avril 2026. Ce rapport, qui ne nomme jamais le nouveau modèle, évoque l'ancien MiMo-V2-Pro : il formule au conditionnel l'hypothèse d'un lancement de MiMo-V2-Pro en essai gratuit destiné à attirer les développeurs pour distiller Claude, et précise que l'enquête n'a pas montré que Xiaomi ait servi à ses utilisateurs les réponses de Claude. Xiaomi n'avait pas répondu dans l'immédiat aux questions de CNBC lors de la publication du rapport, et aucune réponse publique de sa part n'a été relevée depuis.
Pourquoi c'est important
Le million de jetons produits coûte 0,87 dollar chez MiMo-V2.6-Pro contre 10 dollars chez GPT-6 Sol, pour un score presque identique sur l'indice d'Artificial Analysis (46 contre 48). Pour des traitements répétés en grand nombre, cet écart de prix compte davantage que l'écart de score. Les poids ouverts permettent en outre d'héberger le modèle sur ses propres serveurs et de garder ses données chez soi, à condition de dimensionner l'infrastructure pour 1 020 milliards de paramètres. Les faits décrits par Anthropic remontent, eux, à mars et avril, avant la sortie de ce modèle.
Source : Xiaomi MiMo
Héberger un modèle ouvert sur ses propres serveurs →Snorkel AI lève 350 millions de dollars sur une valorisation de 3,5 milliards, près du triple de mai 2025
La levée annoncée le 22 septembre par Snorkel AI atteint 350 millions de dollars, sur une valorisation de 3,5 milliards. L'entreprise fabrique des jeux de données et des environnements d'entraînement pour les laboratoires d'IA et les entreprises. Le tour est co-mené par Insight Partners et S32, avec une participation importante de l'investisseur historique Addition ; le directeur général et cofondateur, Alex Ratner, le qualifie de série E dans un billet de blog. Reuters situe la valorisation précédente à 1,3 milliard de dollars, lors d'une levée de 100 millions en mai 2025, et TechCrunch, qui confirme ces montants, précise qu'il s'agissait d'une série D : le multiple est proche de trois. Issue du laboratoire d'IA de Stanford et fondée en 2019, l'entreprise a lancé en septembre 2025 une offre de données produites avec des experts, vendue comme un service. Depuis, écrit Alex Ratner, l'activité a été multipliée par plus de 18 et le rythme annuel de revenus a franchi cette semaine 375 millions de dollars ; la dépêche de Reuters, fondée sur un entretien avec le même dirigeant, donne 350 millions, contre environ 20 millions un an plus tôt. Snorkel prévoit d'atteindre la rentabilité cette année, selon Reuters, et TechCrunch précise, d'après l'entreprise, que la rémunération de ses experts est comptée dans le coût des ventes. Les fonds doivent accroître la capacité de sa « fabrique de données agentiques », accélérer ses investissements dans l'IA sectorielle et d'entreprise et étendre sa recherche et sa technologie à de nouveaux domaines et à de nouvelles modalités.
Pourquoi c'est important
La valorisation rémunère une matière première précise : des données et des environnements d'entraînement conçus avec des spécialistes pour des travaux longs, dans des secteurs comme la santé, le droit ou le génie logiciel, cités par Lonne Jaffe, d'Insight Partners. Le chiffre qui la justifie est un rythme annuel de revenus franchi « cette semaine », selon Alex Ratner : il extrapole à l'année un niveau récent, sans mesurer douze mois encaissés. Avant de rapprocher Snorkel de Mercor ou de Handshake, un investisseur vérifiera aussi comment chacun comptabilise la rémunération de ses experts.
Source : Snorkel AI (PR Newswire)
Meta corrige en urgence une faille de son agent Muse et reconnaît s'être fortement inspiré d'OpenClaw
Le 22 septembre, peu après minuit à l'heure de la côte Est des États-Unis, David Singleton, des Meta Superintelligence Labs, a annoncé sur X un correctif pour une faille de l'application Mac de Muse, l'agent d'IA personnel de Meta, rapporte Gizmodo. Le chercheur en sécurité Patrick Wardle l'avait révélée la veille. Lancé le 8 septembre, selon Gizmodo, Muse envoie des e-mails, réserve des voyages ou fait des achats ; sur macOS, il fonctionne avec WhatsApp, la messagerie, l'agenda et les réseaux sociaux de l'utilisateur, avec un accès aux fichiers, au micro, à la caméra et à la localisation, décrit Ars Technica. La faille tenait à un réglage non documenté qui permettait de changer le serveur chargé de transcrire la dictée : en le redirigeant vers le sien, un attaquant récupérait le jeton donnant le contrôle complet du compte Muse. Patrick Wardle dit avoir mis au point plusieurs attaques de démonstration, capables par exemple d'écrire des fichiers malveillants sur le disque ou de prendre des photos, souvent sans que l'utilisateur s'en aperçoive ; aucun des articles cités ne fait état d'une exploitation réelle. David Singleton a qualifié la faille d'élévation de privilèges locale, qui suppose un code malveillant déjà actif sur la machine, et jugé le risque pratique « plutôt faible » ; Meta a supprimé le réglage en cause, et Patrick Wardle a salué le correctif sur X à 6 h 36 UTC, selon unite.ai. Ars Technica reproche à Meta d'avoir ignoré la facilité avec laquelle une attaque de type ClickFix, qui amène la victime à coller elle-même une commande, permet de déclencher ce genre de faille. Le même jour, Nat Friedman, responsable produit des Meta Superintelligence Labs, a écrit sur X que Muse avait été construit « de zéro » mais qu'il était « sans aucun doute fortement inspiré, en tant que produit, par OpenClaw », l'agent open source dont le créateur, Peter Steinberger, a été recruté par OpenAI plus tôt dans l'année, rapporte TechCrunch. Interrogé sur la ressemblance des noms de fichiers des deux agents et du contenu de leur fichier SOUL.md, il a répondu que l'équipe jugeait que Peter Steinberger avait vu « exactement juste » sur ces points ; un porte-parole de Meta a renvoyé TechCrunch vers ces propos, sans rien ajouter. Amazon avait par ailleurs commencé, dimanche 20 septembre au soir, à bloquer les achats passés par Muse sur son site, en invoquant ses conditions d'utilisation, selon TechCrunch.
Pourquoi c'est important
La faille logeait dans un réglage anodin, l'adresse du serveur qui transcrit la dictée, qu'un programme lancé sous le compte de l'utilisateur pouvait réécrire pour s'emparer du compte Muse, et avec lui des accès de l'agent. Patrick Wardle le résume : plutôt que d'écrire un logiciel complet de vol de données, il suffit de se servir de l'assistant. Un responsable de la sécurité qui envisage de déployer ce type d'agent sur des postes de travail a donc une liste à établir avant toute installation : les services extérieurs vers lesquels l'agent envoie des données, et qui peut en modifier l'adresse. L'argument de Meta, une attaque qui suppose un code déjà présent sur la machine, vaut ce que vaut la vigilance des utilisateurs face aux commandes qu'on les invite à coller.
Source : TechCrunch