Tag
finops
Gemini 3.7 Flash : Google impose sa cadence sur les modèles workhorse
Trois semaines après Gemini 3.6 Flash, Google annonce le 13 août 2026 Gemini 3.7 Flash, son modèle « workhorse » taillé pour le code et les agents, à moitié prix jusqu'au 31 décembre. Ce que ces chiffres valent, et ce qu'ils changent dans un portefeuille de modèles.
Cloudflare Wallets : donner un budget à un agent, c'est d'abord lui fixer une limite
Le 4 août 2026, Cloudflare donne aux agents IA une identité stable et un portefeuille programmable. Sous le vocabulaire des stablecoins se tient une couche d'autorisation : allocation, allow-list de marchands, montant maximum par transaction. Ce que ça change pour une DSI.
Anthropic sécurise un SDLC où l'IA écrit 80 % du code : le cycle redevient le socle
Le 21 juillet 2026, Jason Clinton (Deputy CISO d'Anthropic) détaille les contrôles qui tiennent un SDLC dont Claude écrit 80 % du code fusionné. Chaque contrôle s'accroche à une étape nommée du cycle. Sans SDLC formalisé, ni gains, ni sécurité, ni FinOps token, ni mesure.
Claude Opus 5 : l'intelligence quasi-frontier au prix du modèle par défaut
Claude Opus 5, lancé le 24 juillet 2026, « s'approche de l'intelligence frontier de Fable 5 à moitié prix », au tarif inchangé d'Opus 4.8. Et pour une DSI européenne, un détail pèse plus qu'un benchmark : Opus 5 préserve le Zero Data Retention que Fable 5 casse.
La famille de modèles Claude : Haiku, Sonnet, Opus, Fable, quel modèle pour quelle tâche
Au 24 juillet 2026, la gamme Claude compte cinq niveaux : Haiku, Sonnet, Opus, puis la classe Mythos (Fable et Mythos). Ce que chacun sait faire, par complexité de tâche et par cas d'usage, et pourquoi choisir le bon niveau est une décision d'architecture.
La course open-weights chinoise : ce que Kimi K3 dit du nouveau marché des modèles
Kimi K3 n'est pas un événement isolé : c'est un coup dans une partie qui se joue à plusieurs : Moonshot, DeepSeek, Z.ai, Qwen. Des labs chinois qui publient leurs poids, cassent les prix et itèrent tous les deux mois. Ce que cette course « commodity » change pour une DSI.
GPT-5.6 Sol, Terra, Luna : comment OpenAI rebat les cartes du coding agentique et du pricing
Le 9 juillet 2026, OpenAI a rendu GPT-5.6 généralement disponible, non pas un modèle mais trois : Sol, Terra, Luna. Lecture d'ingénieurs, chiffrée et sans parti pris : ce que la famille change pour le coût d'inférence, le routing entre modèles et l'équilibre concurrentiel avec Claude.
Sol, Terra, Luna : comment choisir et optimiser les coûts dans la famille GPT-5.6
Avec GPT-5.6, OpenAI ne vend plus un modèle mais une échelle de prix-performance : un facteur 5× entre Luna et Sol. Bien exploitée, elle divise votre facture ; mal exploitée, elle la multiplie. Le guide de décision SFEIR pour choisir le bon tier et optimiser le prompt caching.
Le prix par token est une illusion : mesurer le coût par résultat
Comparer les grilles tarifaires ne dit presque rien de la facture réelle. Sur un cycle agentique, la dépense suit l'ingestion, pas la génération : 153 pour 1. Un modèle « moins cher au token » qui relit plus n'économise rien. Le seul indicateur qui compte est le coût par résultat.
Comment choisir son modèle LLM en 2026 : la carte, pas le classement
Cinq laboratoires, des capacités qui convergent, des prix qui s'effondrent : en 2026, « quel est le meilleur modèle ? » devient la mauvaise question. Voici le cadre de décision qui remplace le classement : router par tâche, mesurer le coût par résultat, rester réversible, investir dans le système.
Meta lance Muse Spark, les prix s'effondrent : pourquoi la guerre des modèles frontier n'est plus le bon combat
En rompant trois ans de silence pour annoncer un modèle agentique à bas prix, Zuckerberg a moins révélé un produit qu'un basculement : la couche frontier se banalise. Cinq laboratoires, des capacités qui convergent, des tarifs qui s'effondrent, et une seule question qui compte pour une DSI.
ZML/LLMD : et si le « Docker des LLM » était français ?
Le 8 juillet 2026, la startup parisienne ZML publie LLMD, un serveur d'inférence qui fait tourner les LLM sur cinq familles de puces (NVIDIA, AMD, Google, Intel, Apple) depuis une seule base de code. Décryptage technique et lecture souveraineté du « Docker des LLM ».
Explorez tous nos articles
Plus de contenus techniques sur l'IA, le Cloud, la Data et le Software Engineering.
Tous les articles