Actu News · lundi 3 août 2026 Monday 3 August 2026 Actu Semaine 32

La guerre des prix a commencé : OpenAI casse Luna de 80 %, Anthropic sort Opus 5 The price war is on: OpenAI cuts Luna by 80%, Anthropic ships Opus 5

En trois semaines, GPT-5.6 Luna perd 80 % de son prix, Opus 5 prend la tête de l'Intelligence Index sans augmenter son tarif, et Kimi K3 ouvre son API à moitié prix — la concurrence bascule de la capacité vers le coût. Plus : des conversations Claude retrouvées dans Google. In three weeks, GPT-5.6 Luna lost 80% of its price, Opus 5 topped the Intelligence Index without raising its rate, and Kimi K3 opened its API at half price — competition shifts from capability to cost. Plus: Claude conversations found in Google.

La une

La bataille des modèles ne se joue plus sur les benchmarks, elle se joue sur la facture.

Le 30 juillet, OpenAI a baissé le prix de GPT-5.6 Luna de 80 % — de 1 $ / 6 $ à 0,20 $ / 1,20 $ par million de tokens (entrée / sortie) — et celui de Terra de 20 % (2,50 $ / 15 $ → 2 $ / 12 $). Le flagship Sol, lui, ne bouge pas (5 $ / 30 $). Le détail qui compte : la famille GPT-5.6 n’avait que 21 jours. Personne ne divise par cinq le prix d’un produit lancé trois semaines plus tôt sans une raison.

La raison, c’est ce qui s’est passé juste avant :

  • Claude Opus 5 (Anthropic, 24 juillet) prend la tête de l’Artificial Analysis Intelligence Index avec 61 points — au même tarif que son prédécesseur Opus 4.8 (5 $ / 25 $), soit environ la moitié du coût par tâche de Fable 5.
  • Kimi K3, le modèle open-weight de 2 800 milliards de paramètres de Moonshot AI, a ouvert son API avec 1 million de tokens de contexte, à environ la moitié du prix des flagships américains.

Trois labos, trois stratégies, un même mouvement : le prix de l’intelligence par tâche s’effondre. Le vocabulaire à retenir, c’est coût par tâche plutôt que prix par token — un modèle deux fois plus cher au token mais qui résout le problème en un seul appel au lieu de cinq revient moins cher. C’est exactement l’argument d’Anthropic sur Opus 5.

🎤 En entretien — « le prix des LLM baisse » est une banalité. « GPT-5.6 Luna est passé de 1 $ à 0,20 $ le million de tokens en entrée trois semaines après son lancement, sous la pression d’Opus 5 et des modèles open-weight chinois » est une réponse datée, chiffrée, sourcée. La différence entre les deux, c’est littéralement de la veille technique — et c’est ce que le recruteur évalue.

Aussi cette semaine

QuoiQuiPourquoi c’est notable
Des conversations Claude partagées retrouvées dans GoogleAnthropicRepéré le 25 juillet : des centaines de chats et Artifacts publics indexés (CV, clés d’API, tableurs financiers). Pages sans noindex. Corrigé le 28 via robots.txt
MAI-Cyber-1-Flash + Project PerceptionMicrosoft27 juillet : premier modèle cyber maison (96 % sur CyberGym) et des agents red / blue / green qui attaquent, trient et patchent. Preview publique le 3 août
API Kimi K3, 1 M de contexteMoonshot AILe plus gros modèle open-weight jamais publié devient une API bon marché — la pression tarifaire vient aussi de là
Fin des tokens npm qui contournent la 2FAnpm / GitHubPremière étape début août : les granular access tokens configurés pour contourner la 2FA perdent les actions sensibles. À vérifier dans vos CI
AZ-204 retirée, remplacée par AI-200Microsoft LearnLa certif « Azure Developer Associate » s’arrête le 31 juillet au profit d’« Azure AI Cloud Developer Associate ». Même le parcours de certif se réécrit autour de l’IA

Pourquoi ça vous concerne

  • Le coût n’est plus une excuse pour ne pas avoir de projet IA. À 0,20 $ le million de tokens en entrée, traiter mille documents dans un side-project coûte quelques centimes. L’argument « je n’avais pas le budget API » ne tient plus devant un recruteur.
  • Savoir choisir son tier devient une compétence. Router les tâches simples (extraction, classification, reformulation) vers un petit modèle et garder le flagship pour le raisonnement dur, c’est une décision d’architecture. En entretien, « j’ai routé 90 % des appels vers le petit modèle et mesuré le coût par tâche » vaut infiniment mieux que « j’ai utilisé l’IA ».
  • L’incident Claude/Google est une leçon de web, pas d’IA. Une URL non devinable n’est pas un contrôle d’accès. Dès qu’un lien « privé » circule sur un forum, un crawler le suit. noindex, robots.txt, et surtout une vraie autorisation côté serveur : ça vaut pour vos projets Astro, Next ou Django exactement comme pour Claude.
  • La sécurité IA se structure côté défense. Après l’intrusion agentique subie par Hugging Face en juillet, Microsoft sort des agents de sécurité. Le sujet passe de la conférence au produit — donc au recrutement.

En entretien

« Tu suis l’actualité tech ? Raconte-moi quelque chose de récent. » — La guerre des prix de fin juillet : la baisse de 80 % sur Luna, Opus 5 en tête de l’Intelligence Index à tarif constant, Kimi K3 en API à moitié prix. Puis la conclusion qui montre que vous avez compris : la concurrence ne porte plus sur « qui a le meilleur modèle » mais sur « qui donne le plus d’intelligence par euro ».

« Comment maîtriseriez-vous le coût d’une fonctionnalité IA en production ? » — Quatre leviers concrets : router par tier selon la difficulté de la tâche, mettre en cache les prompts systèmes répétés, passer en batch ce qui n’est pas temps réel, et surtout mesurer le coût par tâche résolue, pas le coût par token. Ajouter qu’on met un plafond de dépense et une alerte : ça montre qu’on a déjà réfléchi à la prod.

« Un lien de partage, c’est sécurisé ? » — Non. C’est de l’obscurité, pas de la sécurité. Citer l’affaire des conversations Claude indexées par Google fin juillet suffit à illustrer : dès que le lien fuite, la donnée est publique et potentiellement archivée par les moteurs. La bonne réponse reste une autorisation vérifiée côté serveur.

Pour aller plus loin

The big story

The model race isn’t being fought on benchmarks anymore. It’s being fought on the invoice.

On July 30, OpenAI cut GPT-5.6 Luna’s price by 80% — from $1 / $6 to $0.20 / $1.20 per million tokens (input / output) — and Terra’s by 20% ($2.50 / $15 → $2 / $12). Flagship Sol stayed put at $5 / $30. The detail that matters: the GPT-5.6 family was 21 days old. Nobody divides a three-week-old product’s price by five without a reason.

The reason is what happened right before:

  • Claude Opus 5 (Anthropic, July 24) took first place on the Artificial Analysis Intelligence Index with 61 points — at the same price as its predecessor Opus 4.8 ($5 / $25), roughly half the cost per task of Fable 5.
  • Kimi K3, Moonshot AI’s 2.8-trillion-parameter open-weight model, opened its API with a 1-million-token context window, at about half the price of the US flagships.

Three labs, three strategies, one shared move: the price of intelligence per task is collapsing. The phrase to remember is cost per task, not price per token — a model twice as expensive per token that solves the problem in one call instead of five ends up cheaper. That’s precisely Anthropic’s argument for Opus 5.

🎤 In an interview — “LLM prices are falling” is a platitude. “GPT-5.6 Luna went from $1 to $0.20 per million input tokens three weeks after launch, under pressure from Opus 5 and Chinese open-weight models” is dated, specific and sourced. The gap between those two answers is literally tech-watch — and that’s what the recruiter is measuring.

Also this week

WhatWhoWhy it matters
Shared Claude conversations found in GoogleAnthropicSpotted July 25: hundreds of public chats and Artifacts indexed (resumes, API keys, financial spreadsheets). Pages lacked noindex. Fixed July 28 via robots.txt
MAI-Cyber-1-Flash + Project PerceptionMicrosoftJuly 27: first in-house cyber model (96% on CyberGym) plus red / blue / green agents that attack, triage and patch. Public preview August 3
Kimi K3 API, 1M contextMoonshot AIThe largest open-weight model ever released becomes a cheap API — part of where the pricing pressure comes from
End of npm tokens that bypass 2FAnpm / GitHubFirst step in early August: granular access tokens configured to bypass 2FA lose sensitive actions. Check your CI
AZ-204 retired, replaced by AI-200Microsoft LearnThe “Azure Developer Associate” cert ends July 31 in favour of “Azure AI Cloud Developer Associate”. Even the certification path is being rewritten around AI

Why it matters to you

  • Cost is no longer an excuse for having no AI project. At $0.20 per million input tokens, processing a thousand documents in a side project costs pennies. “I didn’t have the API budget” no longer holds up in front of a recruiter.
  • Picking the right tier is becoming a skill. Routing simple tasks (extraction, classification, rewriting) to a small model and keeping the flagship for hard reasoning is an architecture decision. In an interview, “I routed 90% of calls to the small model and measured cost per task” beats “I used AI” by a mile.
  • The Claude/Google incident is a web lesson, not an AI one. An unguessable URL is not access control. The moment a “private” link circulates on a forum, a crawler follows it. noindex, robots.txt, and above all real server-side authorization — that applies to your Astro, Next or Django projects exactly as it does to Claude.
  • AI security is organising on the defence side. After the agentic intrusion Hugging Face suffered in July, Microsoft is shipping security agents. The topic moves from conference talk to product — and therefore to hiring.

In an interview

“Do you follow tech news? Tell me something recent.” — The late-July price war: the 80% cut on Luna, Opus 5 topping the Intelligence Index at a flat rate, Kimi K3’s API at half price. Then the takeaway that shows you understood: competition is no longer about “who has the best model” but “who delivers the most intelligence per euro”.

“How would you keep an AI feature’s cost under control in production?” — Four concrete levers: route by tier based on task difficulty, cache repeated system prompts, move anything non-real-time to batch, and above all measure cost per solved task, not cost per token. Adding that you’d set a spend cap and an alert shows you’ve already thought about production.

“Is a share link secure?” — No. That’s obscurity, not security. Citing the Claude conversations indexed by Google in late July illustrates it in one sentence: once the link leaks, the data is public and potentially archived by search engines. The right answer is still server-side authorization.

Going further

S'entraîner sur ce sujet → Practice this topic →