Tag
modeles-llm
722 preuves en un commit : ce que la publication mathématique d'OpenAI dit de l'avenir de la vérification
Le 6 octobre 2026, OpenAI dépose 722 manuscrits mathématiques sur GitHub ; le 7, elle en retire trois pour une erreur de signe. Villani, LeCun, Tao, et ce que le goulot de la vérification dit aux DSI et CTO qui déploient des agents.
Advisor Claude Code : qui planifie, qui édite, qui lit entre Opus, Sonnet et Haiku 5.5
Une session Claude Code combine un modèle principal, un advisor et des subagents épinglés ; Haiku 5.5 y entre avec la v2.1.293 du 7 octobre 2026. Configuration vérifiée (Sonnet 5.5, advisor Opus 5.5, Haiku 5.5 en lecture seule).
Claude Haiku 5.5 : ce que le nouveau Haiku change pour vos sous-agents
Claude Haiku 5.5 (7 octobre 2026) rejoint le tarif de GPT-6 Luna sous 100 000 tokens et le devance sur les benchmarks constructeur. Seuil des 100k, tokenizer plus gourmand, verbosité à effort élevé, advisor, migration : à vérifier avant d'en faire le modèle de vos sous-agents.
Cloudflare Clef face à Jev : quel modèle de décision choisir, et ce que valent les chiffres
Seize jours après Jev, Cloudflare publie le 1er octobre 2026 Clef et Clef-flash : même API, poids ouverts Apache 2.0, images en entrée, fine-tuning annoncé. Latences non comparables, scores auto-déclarés, prix supérieur à Jev : de quoi choisir entre Jev, Clef, Clef-flash et vos propres GPU.
Mistral Large 4 : 1 000 milliards de paramètres en open-weights, une souveraineté qui se jugera sur la licence
Le 6 octobre 2026, Mistral ouvre en preview API Mistral Large 4 : 1 000 milliards de paramètres, 49 milliards actifs, poids promis pour le 27 octobre. Au niveau des meilleurs open-weights chinois, pas des modèles fermés. Son vrai écart : la cyberdéfense, et une licence encore inconnue.
Aikido Altar : un modèle de sécurité open-weight taillé pour l'air gap
Aikido Security a ramené GLM-5.3 de 1,51 To à 328 Go pour un pentest IA sur quatre H200, dans un réseau coupé d'internet. Sur son benchmark de 32 CVE, Altar garde 23 des 25 failles du modèle d'origine. Méthode, licence et limites.
Gemini 4 Argon : Google reprend la tête des benchmarks, mais garde le modèle pour les défenseurs cyber
Google présente Gemini 4 Argon le 30 septembre 2026 : 1 million de tokens en sortie, tête sur 13 benchmarks sur 18 (mesures Google), tarif d'appel à 2 $ / 10 $. Seuls le gouvernement américain et les défenseurs cyber du programme Fairwind y ont accès. Ce qu'une DSI peut en faire dès maintenant.
GLM-5.3 : les failles du meilleur open source annoncent celles de votre code interne
Anthropic, le NIST et Z.ai ont évalué GLM-5.3 : des exploits de bout en bout proches de Mythos Preview, des refus qui tombent pour 4 400 $ de GPU. Si l'open source cède à ce modèle, votre code interne cédera plus vite. Ce qui marche pour trouver vos failles d'abord.
OpenCode Go, Zen ou vos propres clés : combien coûte vraiment OpenCode
Au 30 septembre 2026, OpenCode Go coûte 10 $ par mois, Go Plus 40 $, Zen se paie à l'usage au prix du fournisseur et le logiciel reste gratuit. Plafonds par modèle, fenêtres de 5 heures, modèles gratuits et accès à Claude : le choix selon votre usage, d'après la documentation officielle.
Claude Sonnet 5.5 : le travail cadré au niveau d'Opus 5.5, au prix de Sonnet
Claude Sonnet 5.5 (28 septembre 2026) garde le tarif de Sonnet 5, 2 $/10 $, et se place à deux ou trois points d'Opus 5.5 sur le travail cadré. Benchmarks, coût par tâche selon l'effort, premiers garde-fous cyber sur un Sonnet, ruptures d'API à traiter avant de migrer.
Claude Opus 5.5 : le niveau de Fable 5.1 au prix d'Opus, et quatre ruptures d'API à traiter
Claude Opus 5.5 (22 septembre 2026) ouvre la famille Claude 5.5 : niveau de Fable 5.1 sur la plupart des tâches, 20 % de moins au token qu'Opus 5, cache read à 0,20 $. Derrière l'annonce : quatre breaking changes, un thinking qu'on ne coupe plus, une facture qui dépend de l'effort.
Union Alpha : le modèle anonyme et gratuit qui sature OpenRouter
Union Alpha est apparu sur OpenRouter le 16 septembre 2026 : multimodal, 262 144 tokens de contexte, gratuit, opéré par un prestataire anonyme qui peut conserver les prompts. État des lieux au 17 septembre, avec ce qui est vérifié, ce qui ne l'est pas, et ce qui aura changé dans une semaine.
Explorez tous nos articles
Plus de contenus techniques sur l'IA, le Cloud, la Data et le Software Engineering.
Tous les articles