Modèles disponibles et prix Boost en USD
Les prix ci-dessous sont les prix publics Boost en dollars américains par million de tokens. Les modèles et prix actifs sont aussi exposés par le catalogue du tableau de bord ; une modification de prix est annoncée au moins 30 jours avant sa prise d'effet lorsqu'elle concerne un abonnement.
| Model ID | Usage | Entrée USD/M tokens | Sortie USD/M tokens |
|---|---|---|---|
glm-4.7-flash | Chat rapide | 0.071 | 0.470 |
deepseek-v4-flash | Volume économique | 0.106 | 0.212 |
hy3 | Généraliste et agentic | 0.165 | 0.682 |
mimo-v2.5 | Chat et agentic | 0.250 | 0.500 |
minimax-m3 | Raisonnement agentic | 0.353 | 1.410 |
glm-4.7 | Chat et code | 0.470 | 2.056 |
kimi-k2.6 | Code agentic, longues sessions | 0.940 | 4.113 |
glm-5.2 | Tâches autonomes longues | 1.093 | 3.525 |
deepseek-v4-pro | Raisonnement premium | 1.528 | 3.055 |
qwen3.7-max | Raisonnement premium | 1.630 | 4.870 |
qwen3.8-max | Flagship code et travail pro | 2.350 | 7.050 |
kimi-k3 | Raisonnement lourd, contexte 1 048 576 tokens | 3.349 | 16.744 |
bge-m3 | Embeddings | 0.012 | — |
qwen3-embedding-8b | Embeddings | 0.012 | — |
qwen3-reranker-8b | Reranking | 0.059 | — |
Les modalités unitaires sont facturées depuis le solde Boost, jamais sur le quota d'un forfait :
| Model ID | Modalité | Prix public |
|---|---|---|
whisper-large-v3 | Transcription audio | 0.01 USD / minute |
kokoro-tts | Synthèse vocale, 8 langues sans arabe | 2 USD / M caractères |
qwen3-tts | Synthèse vocale, arabe inclus + contrôle du ton | 44 USD / M caractères |
flux-1-schnell | Image, palier brouillon | 0.002 USD / image |
flux-2-klein-4b | Image, palier par défaut | 0.03 USD / image |
flux-2-pro | Image, palier qualité | 0.032 USD / image |
fastwan-t2v-1.3b | Vidéo 480p, rapide | 0.005 USD / seconde |
wan2.2-t2v-a14b | Vidéo, palier qualité | 0.15 USD / seconde |
Disponibilité par plan
- Starter :
deepseek-v4-flash,glm-4.7-flash,glm-4.7,hy3, plus les embeddings et le reranking. - Dev : Starter, plus
minimax-m3,mimo-v2.5,kimi-k2.6etglm-5.2. - Pro : Dev, plus
deepseek-v4-proetqwen3.7-max. - Boost uniquement :
kimi-k3etqwen3.8-maxne sont inclus dans aucun abonnement. Ils s'appellent avec une clé disposant d'un solde Boost, au prix au token du tableau ci-dessus.
Les modalités payées à l'usage demandent un solde Boost positif. Le catalogue du tableau de bord fait foi si un modèle est retiré ou rendu indisponible.
Nouveautés média du 2026-08-09
Quatre modèles ajoutés le même jour, tous chez DeepInfra comme le reste du catalogue média — aucune nouvelle relation fournisseur.
flux-1-schnell: 15x moins cher que le palier par défaut. C'est le modèle des brouillons et des séries d'essais, là où payer 0.03 USD par tentative n'a pas de sens.flux-2-pro: qualité nettement au-dessus deflux-2-klein-4bpour ~7 % de plus.flux-2-klein-9bcoûte exactement le même prix et n'apporte rien de plus : il n'a pas été ajouté.qwen3-tts: comble le trou dekokoro-tts, qui ne parle pas arabe. Ajoute aussi le forçage de langue et une consigne de ton en langage naturel. 22x le prix de kokoro — à réserver aux cas où kokoro ne suffit pas.fastwan-t2v-1.3b: 30x moins cher quewan2.2-t2v-a14bet surtout ~100x plus rapide (2,5 secondes de génération mesurées contre 4 min 35 s pour le même clip de 5 secondes). En 480p et avec moins de finesse : c'est le palier itération,wan2.2reste le palier qualité.
Les deux modèles hors forfait
kimi-k3 (Moonshot AI) et qwen3.8-max (Alibaba) sont ajoutés au catalogue le 2026-08-09. Ils ne sont pas dans les forfaits parce que leur coût par token dépasse ce qu'un abonnement à prix fixe peut absorber : kimi-k3 coûte à lui seul plusieurs fois le budget d'un tour de travail sur les modèles inclus. Les vendre à l'unité est la seule façon honnête de les proposer sans dégrader les quotas des autres modèles.
kimi-k3: raisonnement lourd et agentic, fenêtre de contexte de 1 048 576 tokens. Génération lente (de l'ordre de quelques tokens par seconde) — à réserver aux tâches où la qualité du raisonnement prime sur la latence, pas au chat interactif.qwen3.8-max: flagship généraliste, orienté code et travail professionnel, contexte 256k sur la route principale.
Un appel à l'un de ces deux modèles avec une clé d'abonnement sans solde Boost est refusé : ils ne figurent pas dans la liste de modèles autorisés de la clé.
