Postes de coût à comparer avant de quitter Decagon
Avant de comparer des offres, ramenez chaque devis aux mêmes objets facturables : unités variables, fixes récurrents, coûts IA/RAG, exploitation et mise en place.
Unités variables
Une conversation, un message, une résolution et un MAU ne mesurent pas le même usage. Vérifiez l’événement exact qui déclenche la ligne de facture : ouverture du ticket, réponse du bot, résolution automatique, utilisateur actif ou contact unique.
Demandez un export brut des compteurs utilisés pour facturer. Sans journal d’événements, vous ne pourrez pas rapprocher la facture avec vos volumes applicatifs.
Fixes récurrents
Séparez la licence plateforme des sièges agents. Ajoutez les options souvent isolées dans les devis : SSO, rôles avancés, environnements de production et de staging, accès API ou connecteurs natifs.
IA, RAG et exploitation
Le coût IA ne se limite pas au chatbot. Listez les tokens LLM en entrée et sortie, les embeddings, le stockage d’index, les synchronisations de sources et les crawlers de documentation.
Ajoutez les coûts d’exécution : appels d’outils ou fonctions, webhooks sortants, files d’attente, retries, logs, traces et métriques. Ces postes peuvent varier avec les workflows automatisés, même quand le volume de conversations reste stable.
Mise en place et risques
Isolez l’onboarding, les services professionnels, la migration du contenu, le nettoyage de base de connaissance et les tests de non-régression. Si la facturation est en USD, ajoutez aussi les frais de devise, taxes et conditions de change au modèle TCO.
Trois modèles d’alternatives et comment ils facturent
Les suites helpdesk + IA attachent l’automatisation à une licence support existante. La facture peut mélanger siège agent, add-on IA et unité d’usage comme conversation ou résolution (source: Intercom Pricing page (consulted 2026-05); source: Zendesk Pricing page (consulted 2026-05); source: Freshdesk Pricing page (consulted 2026-05)).
La stack DIY LLM + RAG éclate le coût par brique technique: tokens d’entrée/sortie, embeddings, stockage vecteur, requêtes d’index et exécution applicative. OpenAI expose les coûts par famille de modèles et usage tokenisé; Pinecone sépare les dimensions liées à l’index vectoriel et aux opérations associées (source: OpenAI Pricing page (consulted 2026-05); source: Pinecone Pricing page (consulted 2026-05)).
Les plateformes d’agents autonomes ressemblent davantage à un contrat de résultat. Le devis combine souvent engagement annuel, minimum mensuel, résolution facturée et handoff humain lorsque l’agent transfère le cas.
| Modèle | Unité qui pilote la facture | Compromis concret |
|---|---|---|
| Suite helpdesk + IA | Siège, conversation ou résolution | Time-to-value court, mais dépendance forte au SaaS intégré |
| DIY LLM + RAG | Tokens, embeddings, stockage vecteur, requêtes d’index, exécution | Contrôle fin, mais coûts d’ops et maintenance à porter |
| Agents autonomes | Résolution, handoff, minimum mensuel | Alignement sur le résultat, mais contrat moins lisible sans logs d’usage |
L’effet de palier change selon l’unité choisie. Le MAU pénalise les produits à forte audience passive; la conversation colle mieux au support entrant; la résolution suit la valeur créée quand l’automatisation remplace réellement une intervention humaine.
Pour choisir l’unité de facturation, partez d’une valeur métier vérifiable: conversation traitée, résolution confirmée ou coût d’infrastructure contrôlé.
Calculette 5 entrées pour estimer votre TCO mensuel
Utilisez les variables qui pilotent directement la facture: conversations entrantes par mois, messages par conversation, tokens estimés par réponse, taux de déflexion et taux de handoff humain.
Normaliser le volume
Convertissez tout en conversations, messages et résolutions. Une conversation défléchie devient une résolution IA; une conversation transférée devient un handoff humain.
Garder les mêmes entrées
Utilisez ces entrées pour les trois familles afin d’éviter une comparaison directe entre prix par siège et prix par token.
Tester deux profils de trafic
Calculez le TCO sur deux périodes contrastées: une période calme et une période de pic. Ajoutez une marge d’aléa pour pics, retries, longs historiques et surconsommation.
Suite helpdesk + IA
TCO = (sièges + add-on IA) + (coût par conversation × conversations traitées par l’IA)
Les conversations traitées par l’IA correspondent aux tickets défléchis avant agent humain. Les handoffs restent portés par les sièges support.
DIY LLM + RAG
TCO = tokens prompts+réponses + embeddings + stockage/requêtes vecteur + exécution/outillage
Le prompt inclut historique, instructions système et contexte RAG. La réponse utilise votre estimation de tokens par réponse.
Agents autonomes
TCO = forfait plateforme + (coût par résolution × résolutions) + (handoffs × coût agent/siège)
Les résolutions sont les conversations fermées sans agent. Les handoffs ajoutent un coût humain ou un siège, selon le contrat.
Seuils de volume: quel modèle gagne selon votre trafic
| Trafic observé | Modèle à tester en priorité | Vérification TCO |
|---|---|---|
| Faible volume, équipe support réduite | Add-on IA du helpdesk existant | Le TCO peut baisser si l’intégration, les permissions et les workflows sont déjà en place. |
| Volume croissant, corpus produit stable | DIY RAG | Le modèle peut devenir compétitif si l’implémentation, les index et l’observabilité sont amortis sur la durée. |
| Trafic saisonnier ou volatile | Facturation par conversation ou résolution | Évitez le MAU: un pic ponctuel peut gonfler la base facturable après la saison. |
| Contraintes données ou compliance | DIY privé ou SaaS entreprise | Ajoutez la résidence des données, l’isolation, les logs et les majorations contractuelles au coût comparé. |
| Renouvellement annuel | Palier négocié sur usage constaté | Basez le réajustement sur l’usage moyen réel, avec paliers rétroactifs si le volume change. |
Pour un trafic volatile, privilégiez une unité liée au travail support: conversation traitée ou résolution validée.
Au renouvellement, demandez une clause de descente de palier. Elle évite de payer un dimensionnement hérité d’un lancement, d’une migration ou d’un pic saisonnier.
Négocier: clauses de prix qui changent vraiment la facture
Faites inscrire ces clauses dans le bon de commande, pas seulement dans un e-mail commercial. Le prix réel dépend des exceptions prévues au contrat.
Exigez des commits progressifs: le minimum facturé suit votre déploiement réel. Ajoutez une rétroactivité des paliers sur la période contractuelle: si votre usage atteint un palier moins cher, tout l’usage de la période bénéficie du tarif abaissé.
Fixez un cap IA mensuel par usage mesurable: conversations, messages ou résolutions. Au-delà, négociez un tarif dégressif pour l’overage. Demandez aussi un report limité du volume non consommé sur le mois suivant, sans reconduction permanente.
Si le fournisseur facture un forfait d’implémentation, négociez sa conversion en crédits d’usage pendant la première année. La clause évite de payer deux fois: onboarding d’un côté, consommation réelle de l’autre.
Définissez ce qui compte comme « résolu »: intention détectée, absence de réouverture, ou validation explicite. Toute conversation mal qualifiée doit être reclassée gratuitement, avec avoir sur la facture concernée.
Précisez l’export sans frais des embeddings, index, conversations et logs. Ajoutez une période de sortie avec support de migration, afin de basculer sans reconstruire l’historique ni perdre les traces d’audit.
Continue reading
Modèle de rapport hebdo d'ingénierie : livrez en 10 min
Un modèle de rapport hebdomadaire d'ingénierie pour instaurer un rythme de livraison en 10 minutes — sections, exemples, et comment DeployIt l'envoie par email chaque lundi.
Visibilité d’ingénierie sans microgestion: meilleures pratiques
Un cadre actionnable pour rendre visibles flux, résultats et fiabilité à l’échelle équipe, avec rituels asynchrones et garde‑fous qui évitent toute microgestion.
Suivre l'avancement d'ingénierie sans micro-management
Comment suivre l'avancement d'ingénierie sans micro-manager : un rapport hebdomadaire en lecture seule couvrant humains et agents IA, livré chaque lundi.