Die KI sieht das Spiel
Wenn Vorlage und Texterkennung nicht weiterhelfen: mit einem lokalen Modell Zustände erkennen, verzweigen und mehrere Werte in einem Aufruf ablesen.
Manchmal scheitert beides: Eine Vorlage findet nichts, weil das Bild jedes Mal anders aussieht — und die Texterkennung liefert Unsinn, weil da kein Text steht oder der Hintergrund unruhig ist. Genau dafür sind die KI-Module da. Sie beurteilen ein Bild, statt es zu vergleichen.
Wichtig vorweg, damit die Erwartung stimmt: Die KI ist langsamer als eine Vorlagensuche und sie ist nicht für jeden Klick gedacht. Sie lohnt an den wenigen Stellen, an denen es ums Verstehen geht — „läuft gerade ein Kampf, oder bin ich im Menü?“.
Für diese Aufgaben genügt ein lokales Modell auf dem eigenen Rechner. Es braucht keinen Anbieter, keine Kreditkarte, und keine Bilddaten verlassen den Rechner.
Schritt 1 — Ein lokales Modell einrichten
Ollama installieren und starten.
Ein bildfähiges Modell holen. In einem Terminal:
ollama pull qwen2.5vl:7bIn FlowBotCommander: Werkzeuge → Anbieter-Profile, dann „Lokale Modelle suchen“ drücken.
Es muss nicht Ollama sein. Die Suche fragt genauso llama.cpp (Port 8080) und LM Studio (Port 1234)
ab — alle drei beantworten denselben Aufruf, und die App spricht mit allen gleich.
Worauf es dagegen wirklich ankommt, ist das Modell: Ein reines Textmodell sieht keine Bilder. Bei
llama.cpp heißt das, dass neben der Modelldatei auch die mmproj-Datei geladen sein muss — ohne sie
startet der Server zwar, nimmt aber nur den Textteil, und die KI antwortet auf jedes Bild mit
allgemeiner Prosa. Das sieht wie ein Erkennungsfehler aus, ist aber keiner.
llama-server -m qwen2.5-vl-7b-q4_k_m.gguf --mmproj mmproj-qwen2.5-vl-7b-f16.gguf --port 8080
Die Suche fragt die üblichen Adressen ab (Ollama, llama.cpp, LM Studio), legt für jeden Fund ein fertiges Profil an und wählt ein Modell vor, das Bilder lesen kann. Danach Speichern — das war die ganze Einrichtung.
Findet die Suche nichts, ist fast immer der Server nicht gestartet. Das ist keine Vermutung, sondern der häufigste Fall; die Meldung sagt es deshalb ausdrücklich.
Schritt 2 — Der schnellste Test: eine Ja/Nein-Frage
Nimm Bild fragen (KI), setze den Bereich mit dem Bereichs-Werkzeug eng um die Stelle, die zählt, und frage etwas, das nur zwei Antworten hat:
Ist auf dem Bild ein Fehlerdialog zu sehen? Antworte nur mit ja oder nein.
Die Note liefert die Antwort dreifach: als Text (answer), als Zahl (zahl) und als Ja/Nein (jaNein). Für
eine Verzweigung hängst du jaNein an eine Wenn/Dann-Note.
Schritt 3 — Verzweigen mit „KI entscheidet“
Sobald es mehr als zwei Fälle gibt, ist KI entscheidet das richtige Modul. Du schreibst die Möglichkeiten je Zeile hinein:
kampf
menü
ladebildschirm
Die Note bekommt daraufhin die Ausgänge wahl1, wahl2, wahl3 — dazu unklar und fehler.
Zwei Dinge daran sind wichtiger, als sie aussehen:
- „unklar“ musst du nicht eintragen. Die Note hängt diese Möglichkeit selbst an die Frage an. Der Grund ist eine Beobachtung aus der Praxis: Ohne diesen Ausweg wählt ein Modell notfalls falsch, statt sich zurückzuhalten — in einem Versuch mit einem 40×64 Pixel großen Schnipsel, auf dem gar nichts zu erkennen war, antwortete es selbstsicher mit einer der Möglichkeiten. Mit dem Ausweg antwortete es korrekt „unklar“.
- Die Antwort wird gegen deine Liste geprüft. Erfindet das Modell etwas Eigenes oder redet es mehrdeutig
(„kampf oder menü“), geht es nach
unklar. Es geht nie irgendwohin, nur weil ein Wort ungefähr passt.
Hänge an unklar am besten ein kurzes Warten und einen erneuten Versuch — nicht dieselbe Aktion wie an einen
Wahl-Ausgang. „Ich weiß es nicht“ ist eine nützliche Antwort, wenn der Bot sie respektiert.
Schritt 4 — Mehrere Werte in einem Aufruf
Für Zahlen und Namen nimm Werte aus Bild lesen. Je Zeile ein Feldname:
gold
level
gegnername
Jedes Feld wird ein gleichnamiger Daten-Ausgang. Das ist ein Aufruf für drei Werte — mit „Bild fragen“ wären es drei.
Benenne die Felder so, wie du es einem Menschen sagen würdest: gold ist klar, wert1 nicht. Das Modell liest,
was der Name nahelegt. Steht der Wert an einer ungewöhnlichen Stelle, hilft der Zusatz-Hinweis: „Die Zahlen
stehen in der oberen Leiste. Den Chat übergehen.“
Der Bereich ist wichtiger als das Modell
Der wirksamste Griff ist nicht das größere Modell, sondern der enge Bereich. Gemessen an einem echten Spiel-Screenshot in 3440×1474, gleiche Frage, gleiches Modell:
| Was gefragt wurde | Ergebnis |
|---|---|
| ganzes Fenster, auf 1024 px verkleinert | falsch — Werte aus einem anderen Fenster, 4,4 MB ungeskaliert |
| Ausschnitt um die Werte (750×385) | richtig — 54 KB, 0,2 s |
Ein enger Bereich ist also gleichzeitig billiger, schneller und genauer. Nimm dir die halbe Minute mit dem Bereichs-Werkzeug; sie spart mehr als jede andere Einstellung.
Was das kostet — und was es dauert
| lokal | Anbieter (Claude, GPT) | |
|---|---|---|
| Geld je Frage | nichts | nach Bildfläche und Textlänge |
| Dauer | 0,2–0,6 s, wenn das Modell im Speicher liegt | je nach Leitung, meist 1–3 s |
| erster Aufruf | etwa 15 s, das Modell wird geladen | wie gewohnt |
| Daten | bleiben auf dem Rechner | Bildausschnitt geht zum Anbieter |
Die Ladezeit beim ersten Aufruf ist der Grund für das großzügige Zeitlimit in der Vorgabe. Und weil eine Schleife sonst hundert Aufrufe für dieselbe Frage macht, gibt es „Antwort merken für“: Wird dieselbe Frage zum gleichen Bild gestellt, kommt die gemerkte Antwort. Jede Änderung am Bild gilt als neue Frage.
Wenn es nicht klappt
| Was du siehst | Woran es meistens liegt |
|---|---|
| Hinweis „KI ist noch nicht eingerichtet“ am Modul | Kein Anbieter-Profil. Knopf KI einrichten… drücken. |
| „Lokale Modelle suchen“ findet nichts | Der Server läuft nicht. Ollama starten, dann erneut suchen. |
Der Ablauf geht immer nach unklar |
Der Bereich zeigt zu viel oder das Falsche. Enger fassen — und prüfen, ob die Möglichkeiten wirklich zum Bild passen. |
Der Ablauf geht immer nach fehler |
Modellname stimmt nicht, oder das Modell kann keine Bilder. Im Profil ein Modell mit vl, vision oder llava im Namen wählen. |
| Werte werden verwechselt | Der Bereich ist zu groß — siehe oben. Der Zusatz-Hinweis hilft zusätzlich. |
| Die Antwort ist abgeschnitten | Antwortlänge im Anbieter-Profil erhöhen (Feld „Maximale Antwortlänge“). |
| Alles dauert lange | Erster Aufruf lädt das Modell. Danach bleibt es im Speicher — mit „Antwort merken“ wird eine Schleife deutlich billiger. |
Wie geht es weiter?
- KI-Module — alle vier Module mit allen Feldern
- Bilderkennung — wenn eine Vorlage doch reicht: immer die erste Wahl
- Steuer-API — einen Bot von einer KI wie Claude Code bauen und überwachen lassen