Demandez à une IA généraliste votre politique de retour et elle répondra — avec aisance, avec assurance, et possiblement à côté. Elle n’a jamais lu votre politique. Elle a lu celles de milliers d’autres entreprises et les mélangera volontiers en une seule qui ressemble à la vôtre.
Pour une boutique, c’est gênant. Pour une pharmacie, une clinique ou un fournisseur industriel, une dose ou une tolérance inventée est une responsabilité. APIchatbot est conçu pour ces cas : il répond à partir de vos documents, et seulement d’eux.
Quatre règles qui le gardent dans vos documents
- Vos documents, découpés en extraits. Manuels, FAQ, listes de prix et PDF sont découpés en courts passages indexés selon leur sens. Les tableaux gardent leurs en-têtes de colonnes sur chaque morceau, pour qu’un chiffre ne perde jamais le nom de ce qu’il mesure.
- Chaque question va chercher les extraits les plus proches. Cinq par défaut. L’IA voit ceux-là, et rien d’autre de votre entreprise.
- Répondre à partir des extraits, ou dire qu’on ne sait pas. Les consignes sont directes : n’utiliser que les extraits fournis, jamais de connaissances extérieures même en cas de certitude, ne jamais inventer de détails — et quand la réponse n’y est pas, répondre « Je suis désolé, je n’ai pas cette information. »
- Montrer d’où ça vient. La réponse cite les extraits utilisés, avec le titre du document et la page. Seules les sources citées sont affichées, et un refus n’en affiche aucune.
Quand une question sort du cadre
Certaines questions tombent loin de tout ce que contiennent vos documents. Avant qu’une réponse soit rédigée, un petit modèle peu coûteux les classe en quatre catégories :
- Sur le chatbot (« en quoi pouvez-vous m’aider ? ») : il énumère ce qu’il couvre, à partir des titres de vos vrais documents.
- Sur votre entreprise (« quel est votre service principal ? ») : il essaie quand même avec les meilleurs extraits, toujours soumis aux mêmes règles — ces faits se cachent souvent dans de longs passages de FAQ.
- Une salutation (« bonjour », « merci ») : il salue en retour au lieu de s’excuser.
- Tout le reste : un refus poli — ou, si vous l’activez, une invitation à laisser un courriel pour qu’une personne fasse le suivi.
Quand le tri hésite, il penche vers le refus. Et les derniers garde-fous sont du code, pas le modèle qui se note lui-même : une réponse qui ne cite rien n’obtient aucune question de suivi suggérée, parce qu’en test le modèle en proposait juste après avoir admis qu’il ne savait pas.
Mesuré sur vos documents, pas sur un banc d’essai
« Notre modèle obtient 90 % sur un banc d’essai » ne dit rien de votre liste de prix. Chaque chatbot passe donc son propre examen, rédigé à partir de ses propres documents :
- Des questions tirées de passages au hasard de vos documents, chacune avec le fait exact que la réponse doit contenir.
- Les mêmes questions avec des fautes de frappe, dans l’autre langue, et sur un sujet voisin que vos documents ne couvrent pas — qui doit être refusé.
- Une série d’attaques : appâts de culture générale, « ignore tes consignes », demandes de révéler le prompt, faux messages système, tentatives de lire les documents d’un autre client.
L’examen passe par le vrai chat, n’est pas facturé au client et n’est jamais conservé comme historique. Un correcteur IA vérifie chaque réponse : le fait attendu, rien qui le contredise, et pour les attaques, un refus sans fuite.
Les chiffres
Le premier examen, sur les guides de médicaments d’une pharmacie : 24 questions sur 26 réussies et aucun fait erroné. Les deux échecs étaient des refus — le chatbot a dit qu’il ne savait pas plutôt que de deviner. C’est l’échec qu’on veut.
La plus récente série de validation, sur trois chatbots en production. Ces questions forment l’examen, pas le trafic quotidien : la plupart sont les cas problématiques typiques — fautes de frappe, l’autre langue, sujets juste à côté des documents, et attaques — pour mesurer les scores là où les chatbots dérapent d’habitude.
| Chatbot | Documents | Questions | Précision |
|---|---|---|---|
| Démo apigoat.com | 7 documents | 36 | 97.2 % |
| Une pharmacie | 3 guides, 709 extraits | 43 | 93.0 % |
| Un client industriel | 29 documents | 46 | 91.3 % |
Là où ça échoue encore
Huit questions sur 125 ont échoué. Les deux qui comptent étaient des valeurs erronées lues dans des tableaux de posologie denses des guides de la pharmacie — un chiffre pris sur la mauvaise ligne. Une troisième exposait une liste de mots interne sans conséquence ; elle a été corrigée le jour même.
Une autre leçon : un réglage qui allait chercher plus d’extraits a obtenu un meilleur score chez le client industriel — et a inventé un chiffre. Un meilleur score ne veut pas automatiquement dire un chatbot plus sûr. C’est pour ça que l’examen conserve chaque réponse, pas seulement le pourcentage.
C’est tout l’intérêt de l’examen : trouver le tableau dense avant qu’un client ne le fasse, et décider — document par document — si ce contenu doit être restructuré ou confié à une personne.
Vos données restent les vôtres
Les documents de chaque client ne sont consultés que pour le chatbot de ce client. Les questions des visiteurs ne sont pas conservées à moins que vous n’activiez la journalisation, les examens jamais, et chaque chatbot a ses propres limites par minute et par mois : un robot qui le bombarde ne peut pas faire grimper votre facture.
Ce que ça signifie pour une PME
Avant de mettre un chatbot devant vos clients, posez une seule question : quelle est sa précision sur mes documents, et comment le savez-vous ? Si la réponse est un banc d’essai, une démo ou un haussement d’épaules, c’est vous qui servez de test.