La IA ve el juego
Cuando la plantilla y el reconocimiento de texto no bastan: reconocer estados con un modelo local, bifurcar y leer varios valores en una llamada.
A veces fallan las dos cosas: una plantilla no encuentra nada porque la imagen cambia cada vez — y el reconocimiento de texto devuelve tonterías porque no hay texto o el fondo es demasiado movido. Para eso están los módulos de IA. Juzgan una imagen en lugar de compararla.
Algo por delante, para que la expectativa sea correcta: la IA es más lenta que una búsqueda por plantilla y no está pensada para cada clic. Merece la pena en los pocos puntos en los que hace falta entender — «¿hay un combate en marcha o estoy en un menú?».
Para estas tareas basta un modelo local en tu propio equipo. Sin proveedor, sin tarjeta de crédito, y ningún dato de imagen sale del ordenador.
Paso 1 — Configurar un modelo local
Instala Ollama y arráncalo.
Descarga un modelo capaz de leer imágenes. En una terminal:
ollama pull qwen2.5vl:7bEn FlowBotCommander: Herramientas → Perfiles de proveedor, luego pulsa «Buscar modelos locales».
No tiene por qué ser Ollama. La búsqueda consulta igualmente llama.cpp (puerto 8080) y LM Studio
(puerto 1234) — los tres responden a la misma llamada y la aplicación habla con todos del mismo modo.
Lo que sí importa es el modelo: un modelo solo de texto no ve imágenes. En llama.cpp eso significa
que junto al archivo del modelo debe cargarse el archivo mmproj — sin él el servidor arranca
igualmente, pero toma solo la parte de texto, y la IA responde a cada imagen con prosa general. Parece un
fallo de reconocimiento, pero no lo es.
llama-server -m qwen2.5-vl-7b-q4_k_m.gguf --mmproj mmproj-qwen2.5-vl-7b-f16.gguf --port 8080
La búsqueda consulta las direcciones habituales (Ollama, llama.cpp, LM Studio), crea un perfil listo para usar por cada hallazgo y preselecciona un modelo que sabe leer imágenes. Después Guardar — eso era toda la configuración.
Si la búsqueda no encuentra nada, casi siempre es que el servidor no está en marcha. No es una suposición, sino el caso más frecuente; por eso el mensaje lo dice explícitamente.
Paso 2 — La prueba más rápida: una pregunta de sí/no
Coge Preguntar imagen (IA), ajusta el área con la herramienta de área alrededor de lo que importa y pregunta algo con solo dos respuestas:
¿Hay un diálogo de error en la imagen? Responde solo con sí o no.
El módulo entrega la respuesta de tres formas: como texto (answer), como número (zahl) y como sí/no
(jaNein). Para bifurcar, conecta jaNein a un módulo Si/Entonces.
Paso 3 — Bifurcar con «La IA decide»
En cuanto hay más de dos casos, «La IA decide» es el módulo adecuado. Escribes las opciones una por línea:
combate
menú
pantalla de carga
El módulo obtiene entonces las salidas wahl1, wahl2, wahl3 — más unklar (poco claro) y fehler (error).
Dos detalles importan más de lo que parece:
- No tienes que escribir «unklar». El módulo añade esa opción a la pregunta por su cuenta. El motivo viene de la práctica: sin esa salida, un modelo elige mal en vez de contenerse — en una prueba con un fragmento de 40×64 píxeles en el que no se veía nada, respondió con seguridad una de las opciones. Con la salida disponible respondió correctamente «poco claro».
- La respuesta se comprueba contra tu lista. Si el modelo se inventa algo o responde de forma ambigua
(«combate o menú»), el flujo va a
unklar. Nunca va a un sitio solo porque una palabra encaje más o menos.
Conecta unklar a una espera corta y a un nuevo intento — no a la misma acción que una salida de elección. «No
lo sé» es una respuesta útil siempre que el bot la respete.
Paso 4 — Varios valores en una llamada
Para números y nombres coge Leer valores de la imagen. Un nombre de campo por línea:
oro
nivel
nombre_enemigo
Cada campo se convierte en una salida de datos homónima. Es una llamada para tres valores — con «Preguntar imagen» serían tres.
Nombra los campos como se lo dirías a una persona: oro está claro, valor1 no. El modelo lee lo que sugiere el
nombre. Si un valor está en un lugar poco habitual, ayuda la indicación extra: «Los números están en la barra
superior. Ignora el chat.»
El área importa más que el modelo
La palanca más eficaz no es un modelo más grande, es un área ajustada. Medido sobre una captura real de juego en 3440×1474, misma pregunta, mismo modelo:
| Qué se preguntó | Resultado |
|---|---|
| ventana completa, reducida a 1024 px | mal — valores de otra ventana, 4,4 MB sin escalar |
| recorte alrededor de los valores (750×385) | bien — 54 KB, 0,2 s |
Un área ajustada es, por tanto, más barata, más rápida y más precisa a la vez. Dedica el medio minuto a la herramienta de área; rinde más que cualquier otro ajuste.
Lo que cuesta — y lo que tarda
| local | proveedor (Claude, GPT) | |
|---|---|---|
| dinero por pregunta | nada | según superficie de imagen y longitud del texto |
| duración | 0,2–0,6 s mientras el modelo está en memoria | según la conexión, normalmente 1–3 s |
| primera llamada | unos 15 s, se carga el modelo | como siempre |
| datos | se quedan en el equipo | el recorte va al proveedor |
Ese tiempo de carga es la razón del límite de tiempo generoso por defecto. Y porque un bucle haría si no cien llamadas para la misma pregunta, existe «Recordar la respuesta durante»: la misma pregunta sobre la misma imagen devuelve la respuesta recordada. Cualquier cambio en la imagen cuenta como pregunta nueva.
Cuando no funciona
| Qué ves | A qué se debe normalmente |
|---|---|
| Aviso «La IA aún no está configurada» en el módulo | No hay perfil de proveedor. Pulsa Configurar la IA…. |
| «Buscar modelos locales» no encuentra nada | El servidor no está en marcha. Arranca Ollama y busca de nuevo. |
El flujo va siempre a unklar |
El área muestra demasiado o lo equivocado. Ajústala — y comprueba que las opciones encajan de verdad con la imagen. |
El flujo va siempre a fehler |
Nombre de modelo incorrecto, o el modelo no lee imágenes. Elige uno con vl, vision o llava en el nombre. |
| Los valores se confunden | El área es demasiado grande — véase arriba. La indicación extra también ayuda. |
| La respuesta sale cortada | Aumenta la longitud máxima de respuesta en el perfil del proveedor. |
| Todo va lento | La primera llamada carga el modelo. Después se queda en memoria — y «recordar la respuesta» abarata mucho un bucle. |
¿Cómo sigo?
- Módulos de IA — los cuatro módulos con todos sus campos
- Reconocimiento de imagen — si basta una plantilla, siempre es la primera opción
- API de control — que una IA como Claude Code construya y vigile un bot por ti