Des systèmes IA qui atteignent la production, pas seulement la démo
Assistants RAG, déploiement LLM privé et agents autonomes — conçus pour vos données, votre stack, et un coût d’exploitation que vous avez validé à l’avance.
Obtenir mon audit stratégie IA gratuit →Pas prêt à tout écrire ? Réserver un appel de découverte de 15 minutes →
Démo vs production
L’écart entre une démo IA et un système IA en production, c’est là que meurent presque tous les projets.
Une démo répond bien à dix questions. Un système en production en répond dix mille — y compris les mal formulées, celles sur des produits que vous avez arrêtés, et celles conçues pour le faire dire quelque chose pour lequel vous devrez vous excuser. Il faut une retrieval qui remonte le bon document, pas un document plausible. Des citations, pour qu’une mauvaise réponse soit traçable plutôt que mystérieuse. Un modèle de coût — parce que la dépense en tokens scale avec le succès, et un assistant populaire peut devenir silencieusement votre troisième plus gros poste logiciel.
Il faut aussi une réponse honnête à la question que personne ne pose d’abord : est-ce que ça a vraiment besoin d’être de l’IA ? Une FAQ bien écrite et un index de recherche règlent un nombre surprenant de problèmes qu’on scope en chatbots.
Nous construisons ceux qui en ont réellement besoin.
Ce que nous construisons
Assistants RAG & agents support
- Retrieval-augmented generation ancrée dans votre catalogue, docs et politiques
- Réponses avec sources citées — chaque réponse est auditable
- Conscience produit et commande WooCommerce
- Multilingue : anglais, français, arabe
- Logique de handoff humain et escalade
- Widget intégrable ou API complète
Déploiement LLM privé & local
Pour les données qui ne peuvent pas toucher une API tierce.
- Déploiement Ollama, LM Studio et llama.cpp
- Modèles open : Llama, Mistral, Qwen, DeepSeek, Phi
- Dimensionnement GPU avec comparaison coût vs cloud avant engagement
- On-premise ou votre cloud privé
- Les données ne quittent jamais votre infrastructure
Agents IA & automatisation
- Agents tool-using pour tâches multi-étapes
- Orchestration nœuds IA n8n et Make.com
- Tri et rédaction de réponses email
- Qualification de leads et enrichissement CRM
- Garde-fous et plafonds de dépense sur chaque agent
Pipelines contenu & catalogue
- Génération en masse de descriptions produit avec contrôle de la voix de marque
- Traduction catalogue multilingue
- Automatisation métadonnées SEO et schema
- Portes de revue et validation humaine avant toute publication
Recherche sémantique
- Bases vectorielles : pgvector, Pinecone, Chroma
- Pipelines d’ingestion et chunking calibrés à vos types de documents
- Recherche produit on-site qui comprend l’intention
- Bots de connaissance interne pour les équipes
Stratégie & ingénierie des coûts
- Sélection de modèle cloud et local
- Prévision coût tokens au volume projeté
- Prompt engineering et conception système
- Cache et routage pour réduire la dépense API
- Conseil build vs buy honnête — y compris « ne construisez pas ça »
Erreurs fréquentes que nous voyons
Des schémas récurrents dans nos audits. Si vous en reconnaissez deux ou plus, l’écart vous coûte probablement plus que ce qu’il paraît.
RAG sans évaluation sur de vraies questions clients.
La démo répond bien à dix questions préparées. La production en reçoit dix mille, dont la moitié mal formulées.
Pas de plafond de dépense tokens.
Un assistant populaire devient silencieusement votre troisième plus gros poste logiciel.
Pas de citation des sources.
Une réponse fausse est invisible. Avec citation, elle est traçable et corrigeable.
Données catalogue jamais rafraîchies.
L’assistant recommande des produits discontinués avec la même assurance que les produits en stock.
Chatbot scoped là où une FAQ suffirait.
Le ROI négatif était prévisible avant la première ligne de code — personne ne l’a posé comme question.
How We Work
Étape 01 — Périmètre & ROI
Nous identifions l’opportunité à plus forte valeur et définissons une métrique de succès avant d’écrire du code.
Étape 02 — Modèle & plan de coûts
Le bon modèle, cloud ou local, avec une prévision de coût d’exploitation que vous validez.
Étape 03 — Build & intégration
Ingénierie pipeline, intégration stack, garde-fous contre hallucinations et dépenses incontrôlées.
Étape 04 — Évaluation
Tests en conditions réelles contre la métrique de succès, avec tuning de prompt jusqu’à performance.
Étape 05 — Déploiement & monitoring
Mise en production avec logging, monitoring des coûts et support continu.
Ce qui se passe ensuite
Étape 01 — Réponse sous 24 heures.
Une vraie réponse de la personne qui fera le travail, pas un auto-répondeur ni un junior qui planifie un appel pour planifier un appel.
Étape 02 — Nous regardons avant de parler.
Envoyez-nous un accès ou une URL : nous examinons votre configuration réelle d’abord, pour que la conversation démarre sur des constats, pas sur des questions de découverte.
Étape 03 — 30 minutes, les constats d’abord.
Nous vous présentons ce que nous avons trouvé et ce que cela vous coûte. Vous obtenez cela que vous nous engagiez ou non.
Étape 04 — Un périmètre écrit, ou un non honnête.
Si c’est adapté, vous recevez périmètre, calendrier et coût par écrit. Sinon, nous le disons et vous orientons vers une meilleure option.
Pas de retainer requis. Pas de durée minimale. Aucune obligation à aucune étape.
Est-ce fait pour vous ?
Nous préférons vous le dire maintenant plutôt qu’après une facture. Voici pour qui ce travail est rentable, et pour qui il ne l’est pas.
Vous êtes au bon endroit si :
- Vous générez 25 000 €+ par mois de chiffre d’affaires en ligne — quelques points d’attribution récupérés représentent un montant réel
- Vous diffusez des campagnes payantes et les chiffres remontés ne correspondent pas à votre compte en banque
- Vous vendez sur plusieurs marchés, devises ou boutiques
- Vous avez un développeur ou une agence capable d’agir sur nos recommandations
- Vous voulez posséder l’implémentation ensuite, pas la louer
Probablement pas fait pour vous si :
- Vous êtes en phase de validation produit — réglez la demande d’abord, mesurez ensuite
- Vous cherchez quelqu’un pour gérer vos dépenses média au quotidien ; nous construisons la couche de mesure, nous ne sommes pas une agence media buying
- Vous avez besoin que ce soit en ligne cette semaine ; une implémentation sérieuse a une phase de validation que nous ne sautons pas
- Vous voulez le devis le moins cher — ce n’est pas nous, et le tracking le moins cher finit souvent par être refait
La plupart des mandats démarrent à partir de 1 500 €. Nous confirmons périmètre et coût lors de l’appel de découverte, avant tout engagement.
Parlez-nous de votre configuration. Nous répondons sous 24 heures.
Questions
fréquentes
La retrieval-augmented generation ancre chaque réponse dans vos documents réels, et nous exigeons des citations sources pour qu’une affirmation non fondée soit visible plutôt qu’invisible. Quand le système ne trouve pas de réponse fondée, il le dit et escalade au lieu de deviner.
Le local gagne sur la confidentialité des données, le coût prévisible à fort volume et l’absence de vendor lock-in — au prix du hardware et de la maintenance. Le cloud gagne sur la capacité et zéro infrastructure. Nous modélisons les deux selon votre volume et vos exigences, et vous donnons les chiffres plutôt qu’une préférence.
C’est la question que la plupart des projets IA sautent jusqu’à ce que ce soit un problème. Nous prévoyons la dépense en tokens au volume projeté en phase de cadrage, puis ingénions cache et routage pour la réduire. Vous validez un montant mensuel avant le build.
Oui, via intégration API authentifiée avec votre boutique — avec permissions scopées et contrôles d’accès pour qu’il ne voie que ce qu’un utilisateur donné est autorisé à voir.
Le self-hosting supprime le problème de transfert vers un tiers — c’est une grande partie de la réponse. Il faut quand même une base légale, des limites de rétention et une sécurité adaptée. Nous construisons selon ce que votre conseil prescrit et documentons le flux de données.
Le build démarre autour de 1 500 € pour une implémentation ciblée et augmente avec la complexité du pipeline de données. Le chiffre qui compte davantage, c’est le coût d’exploitation — que la plupart des projets découvrent trop tard. Nous prévoyons la dépense en tokens à votre volume projeté en phase de cadrage et ingénions cache et routage pour la maîtriser. Vous validez un montant mensuel avant le build.
Typiquement trois à six semaines. Déployer un modèle contre vos documents est rapide. Le temps va à l’ingestion et au chunking calibrés à vos types de documents, l’évaluation sur de vraies questions, et les garde-fous qui empêchent de répondre avec assurance quand il faudrait escalader.
Les modèles cloud sont plus capables et ne demandent pas d’infrastructure. Les modèles self-hosted gardent les données sur vos systèmes, coûtent de façon prévisible à fort volume et évitent le vendor lock-in. Pour des assistants client face à des questions catalogue ordinaires, le cloud gagne généralement. Pour tout ce qui touche des données qui ne peuvent pas quitter votre infrastructure, le self-hosted gagne quelle que soit la capacité. Nous modélisons les deux selon votre volume.
Non — et traiter le projet ainsi, c’est comment ils échouent. Un assistant bien construit gère la majorité répétitive — statut de commande, compatibilité produit, questions de politique — et escalade le reste avec le contexte attaché. Votre équipe passe moins de temps sur les questions qui n’avaient jamais besoin d’un humain. Celles qui en avaient en atteignent toujours un.
Pas avec les configurations que nous déployons. Les offres business des grands fournisseurs excluent les entrées API de l’entraînement par défaut, et les modèles self-hosted ne transmettent jamais de données. Nous documentons le flux exact pour chaque intégration afin que votre politique de confidentialité et toute demande CNIL puissent être répondues depuis un registre écrit, pas une supposition.
Prêt à construire quelque chose qui fonctionne ?
Réservez un audit stratégique gratuit de 30 minutes. Pas de pitch deck, pas de pression — un regard honnête sur votre setup et les priorités de correction.
Pas prêt à tout écrire ? Réserver un appel de découverte de 15 minutes →
