Les PME perdent des heures chaque semaine dans le courrier entrant. Pas à y répondre : à décider ce que c'est. Un fournisseur qui confirme une date, une facture, une vraie demande de mandat, et quarante messages de bruit dans la même enveloppe.

Voici le journal de bord d'un agent qui prend cette décision, sur du matériel qui coûte moins qu'un mois de budget IA typique. L'intérêt de l'écrire n'est pas la machine. C'est que l'écart entre une démo et un outil qu'on peut laisser tourner est fait de décisions d'ingénierie — et c'est cela qu'une PME achète réellement.

Le projet

L'agent s'appelle apigmail. Il lit le courrier entrant et produit, pour chaque message, trois choses : de quel type de message il s'agit, ce qui doit lui arriver et son degré d'urgence. Ce qui exige un humain reçoit un court résumé et une prochaine action proposée. Le reste est classé, archivé ou jeté sans que personne le regarde.

Il tourne sur un Mac mini posé sur une tablette — 1 199 $ CAD, seize gigaoctets de mémoire unifiée, acheté une seule fois. Aucune location de GPU, aucune facture au jeton, et aucun courriel qui sort de l'entreprise, ce dernier point étant le premier que soulèvent les clients réglementés.

$1,199CAD — toute l'installation, un Mac mini M4
16 GBmémoire unifiée
$0dépense API mensuelle

La cible

Avant de construire quoi que ce soit, il fallait écrire la tâche sous une forme qui puisse réussir ou échouer. On n'ingénie rien contre des ambitions vagues ; contre celles-ci, oui :

  1. Ne jamais jeter un message légitime. Un courriel de client perdu est pire que pas d'automatisation du tout, parce qu'à ce stade on fait confiance à la boîte.
  2. Ne jamais rater un message qui exige une réponse. Le rappel sur cette classe compte plus que l'exactitude globale.
  3. Décider sans intervention humaine dans les cas clairs, et escalader le reste plutôt que deviner.
  4. Terminer son travail durant la nuit sur du matériel déjà possédé, sans qu'aucune donnée ne quitte le réseau.

Puis la mesure : deux cents courriels d'affaires synthétiques, écrits et étiquetés à la main, chaque expéditeur et chaque domaine inventés pour que le jeu de test ne contienne le vrai courrier de personne — avec une trentaine de cas volontairement difficiles : des réponses sans conversation derrière, des messages en français, en espagnol et en allemand, des démarchages déguisés en mots personnels. Chaque version depuis est notée sur ce même jeu par macro-F1 par axe, parce que les classes sont déséquilibrées et qu'une simple exactitude flatterait le résultat. Et une livraison doit franchir un seuil fixe avant d'être mise en service : au plus 0,5 % de JSON invalide, au plus 0,5 % de courrier légitime jeté, au moins 0,90 de rappel et 0,85 de précision sur le courrier qui exige une réponse, au moins 0,75 de rappel sur les indésirables. Ce jeu de test s'est révélé l'artefact le plus précieux du projet.

Corriger la mesure avant le modèle

Avant : la tuile d'exactitude affichait 23,5 %. Elle ne mesurait pas ce qu'elle prétendait — un bloc de lignes de rétroaction humaine avait été enregistré comme des corrections alors que c'étaient des confirmations.
Avant : la tuile d'exactitude affichait 23,5 %. Elle ne mesurait pas ce qu'elle prétendait — un bloc de lignes de rétroaction humaine avait été enregistré comme des corrections alors que c'étaient des confirmations.
Après : les mêmes compteurs une fois la file de rétroaction révisée — 67,7 %. Rien n'a été réentraîné ni réécrit entre les deux.
Après : les mêmes compteurs une fois la file de rétroaction révisée — 67,7 %. Rien n'a été réentraîné ni réécrit entre les deux.

Cela mérite un paragraphe parce que c'est l'échec le plus courant dans ce type de travail. Une semaine d'ajustements contre une métrique cassée produit des absurdités mesurables et assurées. Avant d'optimiser quoi que ce soit, vérifiez que le chiffre décrit bien ce que vous croyez qu'il décrit.

À quoi la démarche a réellement ressemblé

Trois versions de modèle et huit versions de prompt, toutes notées sur le même jeu de test. Quatre constats méritent d'être transmis.

Un modèle plus gros n'a rien apporté. La première version demandait à un modèle 8B la catégorie, le verdict et la priorité en une passe : excellent pour repérer qu'un humain avait écrit, nul devant les indésirables — deux sur vingt-cinq détectés, vingt marqués comme exigeant une réponse. Passer à un modèle 14B n'a rien changé au schéma de confusion et a légèrement fait baisser le score de verdict, de 0,473 à 0,435, pour deux secondes et demie de plus par message.

Écrire les règles a rapporté plus que le matériel. Même modèle, même machine : énoncer explicitement les règles de décision — ce qui sépare un message à archiver d'un message à laisser tranquille, ce qui rend une chose indésirable, à quoi ressemble une infolettre qui se fait passer pour un mot personnel — a fait passer le score de verdict de 0,435 à 0,692.

Le verdict n'a pas sa place dans le modèle. Le changement le plus important a été structurel. Le modèle n'extrait plus que des faits observables : qui écrit, y a-t-il une demande, y a-t-il une offre, quelqu'un réclame-t-il un paiement ou un identifiant. Du code déterministe combine ces faits avec un contexte que le modèle ne peut pas connaître — correspondance antérieure avec cet expéditeur, avons-nous répondu, présence au carnet d'adresses, domaines qui ne font que ressembler à une marque connue — et c'est ce code qui produit le verdict. Le rappel sur les indésirables est passé de 0,24 à 0,76 sans qu'un seul message légitime soit jeté. Le prix était honnête : la latence a augmenté d'environ deux tiers, de 12,6 à 20,6 secondes par message.

Deux livraisons ont été rejetées, et c'est précisément à ça que sert le seuil. Un prompt reformulé n'a gagné aucune précision et perdu trois points de rappel sur les messages à répondre. Une version 9B plus rapide en quantification quatre bits affichait les meilleurs scores de catégorie du projet et a tout de même échoué : le rappel sur les indésirables tombait à 0,60 et elle a jeté un courriel légitime. Il a fallu deux versions de prompt de plus — marques imitées dans des domaines composés, fausses chaînes de réponses, respect du courrier déjà lu, conversations en cours laissées tranquilles — avant que ce modèle soit sûr.

Les résultats

~4,500courriels par jour, plafond
19 sen moyenne par courriel
0.97 / 0.96précision / rappel, à répondre
0courriel légitime jeté
EssaiVersionF1 verdictÀ répondre P / RIndésirable P / RIssue
01hermes3:8b · v10.4730.71 / 1.001.00 / 0.08référence
02qwen3:14b · v20.4350.76 / 0.971.00 / 0.16modèle plus gros, aucun gain
03qwen3:14b · v30.6920.78 / 0.941.00 / 0.24règles explicites
04qwen3:14b · v40.8350.88 / 0.961.00 / 0.76le code décide du verdict
05qwen3:14b · v50.8380.96 / 0.901.00 / 0.72rejetée — rappel perdu
06qwen3.5:9b · v60.8240.94 / 0.950.94 / 0.60échec — un vrai courriel jeté
07qwen3.5:9b · v70.8740.96 / 0.951.00 / 0.77acceptée
08qwen3.5:9b · v80.8680.97 / 0.961.00 / 0.77actuelle

La version actuelle fait tourner un modèle 9B en quantification quatre bits, réflexion désactivée, fenêtre de contexte de 8k. Sur le jeu de test, elle atteint 0,97 de précision et 0,96 de rappel sur le courrier qui exige une réponse, une précision parfaite sur les indésirables, et aucun message légitime jeté. Sur la boîte réelle, elle tourne sous les dix-neuf secondes par message et envoie au modèle environ un quart de texte en moins que la première version fonctionnelle.

La capacité, puisqu'elle détermine si tout cela tient à l'échelle d'une entreprise. Le mini répond à une requête à la fois : le plafond est donc une simple division. 86 400 secondes dans une journée divisées par environ 19 secondes par message donnent quelque 4 500 messages par jour. Le goulot d'étranglement, c'est le modèle — ni le disque, ni le réseau, ni le fournisseur de courriel. Une entreprise qui reçoit quelques centaines de messages par jour n'utilise qu'une petite fraction d'un seul ordinateur de bureau, et la marge est là pour les jours où tout le monde écrit en même temps.

Et ce plafond n'est que le plancher de ce qu'un budget permet. Le travail se fait un message à la fois, ce qui le rend parallélisable sans effort : une deuxième machine à 1 199 $ double le plafond, sans rien changer à la conception. Plutôt que d'ajouter des boîtiers, un budget plus large achète un modèle plus gros ou une fenêtre de contexte plus longue sur une seule machine — et un modèle hébergé reste la bonne réponse pour tout ce qu'une personne attend en direct. L'intérêt de commencer ici n'est pas que ce soit la limite : c'est que le matériel le moins cher possible traite déjà plusieurs fois le courrier d'une PME, ce qui permet de mettre l'argent là où il faut du jugement.

En test de production

La prochaine amélioration mène la même machine plus loin. Un courriel en environ neuf secondes au lieu de dix-neuf, et un plafond d'environ 9 500 courriels par jour sur un flux, 16 000 sur deux — sur la même machine à 1 199 $, sans rien acheter.

Latence médiane selon la taille du prompt. L'attente suit la quantité de texte envoyée, pas la difficulté de la décision — dégraisser l'historique cité et les signatures est l'accélération la moins chère, quel que soit le matériel. 20k+ est plus rapide parce que c'est plus grand que le contexte et que le contenu est coupé à 8k.
Latence médiane selon la taille du prompt. L'attente suit la quantité de texte envoyée, pas la difficulté de la décision — dégraisser l'historique cité et les signatures est l'accélération la moins chère, quel que soit le matériel. 20k+ est plus rapide parce que c'est plus grand que le contexte et que le contenu est coupé à 8k.

Le compromis. Plus court, c'est plus rapide : rien au-delà de 8 000 caractères n'est lu — le modèle reçoit les 6 000 premiers et les 2 000 derniers, et le milieu d'un très long courriel est ignoré. C'est pourquoi 20k+ revient plus vite que 10–20k.

Une réserve, dite clairement : toutes les confirmations humaines recueillies jusqu'ici portent sur la version 14B retirée.

Ce que ça signifie pour une PME

Le matériel n'a jamais été le plus difficile, le modèle non plus. Chaque gain significatif est venu d'une décision d'ingénierie : mesurer correctement, écrire les règles, sortir le jugement du modèle pour le mettre dans du code testable, et maintenir un seuil autorisé à rejeter votre propre travail.

C'est exactement ce que procurent deux décennies à construire des systèmes, et c'est pourquoi une petite entreprise n'a pas besoin d'un budget IA pour obtenir un outil qui se rentabilise. Un ordinateur de bureau bon marché, un modèle à poids ouverts et quelqu'un qui l'a déjà fait : une combinaison à la portée de la plupart des PME — et elle donne un outil qui tourne chaque nuit, ne coûte rien par message et garde votre correspondance chez vous.

Si une décision récurrente de votre entreprise ressemble à celle-ci — gros volume, règles claires, coûteuse seulement parce qu'une personne doit la prendre — cela vaut une demi-heure pour savoir ce qu'il faudrait.