Gemini 3.6 Flash est un candidat efficace pour un pilote multimodal de code, de documents et d’agents bornés. Sa valeur ne se réduit pas au benchmark : Google annonce moins de tokens de sortie que 3.5 Flash, tandis que les retours montrent que le gain n’existe que si la vérification reste rapide.
Le repère est l’annonce Google du 21 juillet 2026 et la carte vérifiée le 20 septembre : gemini-3.6-flash, entrée 1 048 576, sortie 65 536, entrées texte/image/vidéo/audio/PDF et Standard payant à 1,50/7,50 dollars par million. 3.7 et 3.8 sont des routes voisines, pas des remplacements automatiques. Commencez par la page du modèle (English).
Décision rapide
Choisissez 3.6 pour le multimodal, les boucles rapides et moins de sortie.
La baisse de 17 % est une comparaison datée, pas une économie universelle.
Gardez une vérification indépendante : hallucinations, timeouts et cutoff sont documentés.
Séparez API, AI Studio/Antigravity, contrats Enterprise et Tabbit.
Un agent qui écrit doit produire diff, tests et condition d’arrêt.
Fiche
| Sujet | Donnée vérifiée | Limite |
|---|---|---|
| ID | gemini-3.6-flash stable | Vérifier l’ID exact du client. |
| Entrées | Texte, image, vidéo, audio, PDF | Le client peut en exposer moins. |
| Tokens | 1 048 576 entrée ; 65 536 sortie | Le plan peut réduire la fenêtre effective. |
| Outils | Cache, code, computer use preview, recherche, fonctions, grounding, sortie structurée, URL | L’API ne garantit pas l’exposition par le compte. |
| Prix | 1,50 entrée / 7,50 sortie par million | Gratuit, outils et retries ont leurs règles. |
| Cutoff | Mars 2026 | Les faits actuels demandent des sources. |
Lisez ce qu’est un navigateur agentique, la comparaison de navigateurs IA et les pratiques Tabbit.
De 3.5 à 3.6, puis 3.7
Google présente 3.6 comme le successeur de travail de 3.5 : code, connaissance et multimodal, avec 17 % de sortie en moins dans la comparaison citée. L’annonce donne aussi DeepSWE 49 contre 37, MLE-Bench 63,9 contre 49,7, OSWorld 83,0 contre 78,4 et GDPval-AA Elo 1421 contre 1349. Ce sont des comparaisons choisies par le fournisseur, pas un audit indépendant.
3.7 et 3.8 ne rendent pas 3.6 inutile. Si 3.6 finit une tâche bornée avec moins de boucles et une relecture facile, son efficacité compte. Pour l’autonomie longue, testez la route suivante avec le même fixture. Le guide de raisonnement agentique aide à noter effort, outils et corrections.
Résultats et essais indépendants
La carte donne SWE-Bench Pro 58,7 %, DeepSWE 49 %, Terminal-Bench 78,0 %, MLE-Bench 63,9 %, OSWorld 83,0 %, CharXiv sans outils 85,2 % et GDM-MRCR 1M 54,0 %. Ces lignes correspondent à des tâches différentes, pas à un score composite. La mesure 1M ne garantit pas qu’un très long prompt soit économique ou stable. Conservez les conditions dans les prompts (English) et revues (English) sans copier de prompt tiers.
Promptslove décrit 24 heures avec OpenCode, high thinking et quatre tâches : frontend, jeu navigateur, formulaires et vidéo Instagram. Formulaires, CSV, édition et vidéo auraient fonctionné, mais le frontend aurait manqué pointeurs de défilement, compteurs, responsive et finition. Reddit rapporte une bonne vitesse sur tâches bornées, mais aussi des vérifications non discriminantes, une action risquée, des tests oubliés, des règles Firebase ignorées, des erreurs 400 et de la répétition en long contexte. Ce sont des coûts de supervision ; voir la collection de revues (English).
Prix, données et premier test
La ligne Standard payante était à 1,50/7,50 dollars par million, thinking inclus dans la sortie. Google indique que le niveau gratuit peut utiliser le contenu pour améliorer ses produits, tandis que le niveau payant ne le fait pas. Vérifiez le pays et les conditions actuelles avant d’envoyer des données sensibles. Cache, Search grounding, outils, reprises et abonnements sont séparés.
AI Studio, API, Antigravity, Android Studio et Enterprise peuvent différer en quotas. Tabbit est une route distincte ; l’automatisation de navigateur aide à construire le test, pas à transformer une session en facture Gemini.
Aucune tâche Tabbit authentifiée ni capture admissible n’a été réalisée. Nous ne revendiquons donc ni sélecteur, ni contexte, ni latence, ni quota, ni prix. Si le modèle apparaît, extrayez cinq faits d’une page publique, vérifiez les liens et n’accordez pas l’écriture au premier essai.
Verdict
Gemini 3.6 Flash est un candidat efficace pour le code multimodal et les agents bornés. Les données Google suggèrent un progrès sur 3.5, mais quota, supervision et vérification peuvent effacer l’économie. Pilotez avec un fixture fixe ; passez à 3.7 ou 3.8 seulement si leur autonomie compense la relecture supplémentaire.
Sources
Questions fréquentes
Qu’est-ce que Gemini 3.6 Flash ?
C’est le modèle Flash multimodal stable de Google pour le code, la connaissance et les agents. Il accepte texte, image, vidéo, audio et PDF, avec 1 048 576 tokens en entrée et 65 536 en sortie.
Qu’est-ce qui change par rapport à 3.5 Flash ?
Google cite 17 % de tokens de sortie en moins dans une comparaison Artificial Analysis et de meilleurs résultats de code et multimodaux. C’est une comparaison datée, pas une baisse garantie du coût de chaque tâche.
Quel est le prix ?
Le 20 septembre 2026, la ligne Standard payante de Google indiquait 1,50 dollar par million de tokens d’entrée et 7,50 de sortie. Les outils, reprises et conditions gratuites sont séparés.
Est-il adapté aux agents de code ?
La carte Google indique 58,7 % à SWE-Bench Pro, 78,0 % à Terminal-Bench 2.1 et 83,0 % à OSWorld-Verified. Les essais indépendants privilégient les tâches bornées et supervisées.
Quelles sont ses limites ?
Google mentionne les hallucinations, des lenteurs ou timeouts occasionnels, le renforcement continu contre les jailbreaks et une coupure de connaissances en mars 2026. La communauté ajoute quotas, tests oubliés et répétition.
Est-il disponible dans Tabbit ?
Aucun test authentifié Gemini 3.6 Flash n’a été exécuté dans Tabbit pour cet article. Vérifiez le sélecteur et les conditions du compte.