La plupart des automatisations se contentent de la recherche d'image et de la reconnaissance de texte. Parfois les deux échouent — l'image change à chaque fois, ou il n'y a pas de texte du tout. C'est là qu'intervient l'IA : elle juge une image au lieu de la comparer.
Tu listes les états possibles — combat, menu, écran de chargement — et le flux bifurque vers celui que l'IA voit. Et si elle n'est pas sûre, elle prend la sortie « incertain » au lieu de deviner. La réponse est toujours vérifiée contre ta liste : elle ne peut pas inventer un état.
Or, niveau, nom de l'ennemi : un appel, une sortie par valeur. Utile partout où la reconnaissance de texte abandonne — petits caractères, fond chargé, chiffres dessinés dans une image.
Celui-ci se passe en dehors de l'application : via l'API de commande, un assistant comme Claude Code ou Codex peut lire le catalogue des modules, écrire un bot, le faire vérifier, le lancer, lire le journal — et même regarder une capture pour corriger ses propres erreurs.
Pour reconnaître ce qui est à l'écran, un modèle local sur votre machine suffit — c'est ainsi que nous l'avons vérifié. L'application trouve elle-même un serveur de modèles en cours d'exécution et présélectionne un modèle capable de lire des images.
| Modèle local | Fournisseur (Claude, GPT …) | |
|---|---|---|
| Coût par question | aucun | selon la surface de l'image et la longueur du texte |
| Vitesse | 0,2–0,6 s une fois le modèle chargé ; le premier appel prend environ 15 s | généralement 1–3 s, selon la connexion |
| Données | l'image reste sur votre ordinateur | la zone choisie part chez le fournisseur |
| Installation | installer Ollama, récupérer un modèle, cliquer sur « Chercher des modèles locaux » | saisir la clé du fournisseur |
Une mesure à connaître : une zone serrée bat la fenêtre entière. À capture et question identiques, la fenêtre entière réduite a été mal lue, alors qu'un extrait de 750×385 du bon endroit a été lu correctement — pour 54 Ko au lieu de 4,4 Mo.
Pas pour chaque clic. Une recherche d'image prend des millisecondes et répond toujours pareil ; l'IA prend des dixièmes de seconde et peut se tromper. Utilisez-la là où il faut comprendre, et laissez le reste au modèle d'image et à la reconnaissance de texte.
Et elle ne dispense pas de la responsabilité : un bot qui clique tout seul peut cliquer au mauvais endroit. Le filet de sécurité — touche panique, marche à blanc, arrêt d'urgence — compte autant avec l'IA que sans.