Inhalt
Dokumentation › Anleitungen

Die KI sieht das Spiel

Wenn Vorlage und Texterkennung nicht weiterhelfen: mit einem lokalen Modell Zustände erkennen, verzweigen und mehrere Werte in einem Aufruf ablesen.

Zuletzt aktualisiert: 2026-09-17

Manchmal scheitert beides: Eine Vorlage findet nichts, weil das Bild jedes Mal anders aussieht — und die Texterkennung liefert Unsinn, weil da kein Text steht oder der Hintergrund unruhig ist. Genau dafür sind die KI-Module da. Sie beurteilen ein Bild, statt es zu vergleichen.

Wichtig vorweg, damit die Erwartung stimmt: Die KI ist langsamer als eine Vorlagensuche und sie ist nicht für jeden Klick gedacht. Sie lohnt an den wenigen Stellen, an denen es ums Verstehen geht — „läuft gerade ein Kampf, oder bin ich im Menü?“.

Für diese Aufgaben genügt ein lokales Modell auf dem eigenen Rechner. Es braucht keinen Anbieter, keine Kreditkarte, und keine Bilddaten verlassen den Rechner.

Schritt 1 — Ein lokales Modell einrichten

  1. Ollama installieren und starten.

  2. Ein bildfähiges Modell holen. In einem Terminal:

    ollama pull qwen2.5vl:7b
    
  3. In FlowBotCommander: Werkzeuge → Anbieter-Profile, dann „Lokale Modelle suchen“ drücken.

Es muss nicht Ollama sein. Die Suche fragt genauso llama.cpp (Port 8080) und LM Studio (Port 1234) ab — alle drei beantworten denselben Aufruf, und die App spricht mit allen gleich.

Worauf es dagegen wirklich ankommt, ist das Modell: Ein reines Textmodell sieht keine Bilder. Bei llama.cpp heißt das, dass neben der Modelldatei auch die mmproj-Datei geladen sein muss — ohne sie startet der Server zwar, nimmt aber nur den Textteil, und die KI antwortet auf jedes Bild mit allgemeiner Prosa. Das sieht wie ein Erkennungsfehler aus, ist aber keiner.

llama-server -m qwen2.5-vl-7b-q4_k_m.gguf --mmproj mmproj-qwen2.5-vl-7b-f16.gguf --port 8080

Die Suche fragt die üblichen Adressen ab (Ollama, llama.cpp, LM Studio), legt für jeden Fund ein fertiges Profil an und wählt ein Modell vor, das Bilder lesen kann. Danach Speichern — das war die ganze Einrichtung.

Findet die Suche nichts, ist fast immer der Server nicht gestartet. Das ist keine Vermutung, sondern der häufigste Fall; die Meldung sagt es deshalb ausdrücklich.

Schritt 2 — Der schnellste Test: eine Ja/Nein-Frage

Nimm Bild fragen (KI), setze den Bereich mit dem Bereichs-Werkzeug eng um die Stelle, die zählt, und frage etwas, das nur zwei Antworten hat:

Ist auf dem Bild ein Fehlerdialog zu sehen? Antworte nur mit ja oder nein.

Die Note liefert die Antwort dreifach: als Text (answer), als Zahl (zahl) und als Ja/Nein (jaNein). Für eine Verzweigung hängst du jaNein an eine Wenn/Dann-Note.

Schritt 3 — Verzweigen mit „KI entscheidet“

Sobald es mehr als zwei Fälle gibt, ist KI entscheidet das richtige Modul. Du schreibst die Möglichkeiten je Zeile hinein:

kampf
menü
ladebildschirm

Die Note bekommt daraufhin die Ausgänge wahl1, wahl2, wahl3 — dazu unklar und fehler.

Beispiel-Bot herunterladen

Zwei Dinge daran sind wichtiger, als sie aussehen:

  • „unklar“ musst du nicht eintragen. Die Note hängt diese Möglichkeit selbst an die Frage an. Der Grund ist eine Beobachtung aus der Praxis: Ohne diesen Ausweg wählt ein Modell notfalls falsch, statt sich zurückzuhalten — in einem Versuch mit einem 40×64 Pixel großen Schnipsel, auf dem gar nichts zu erkennen war, antwortete es selbstsicher mit einer der Möglichkeiten. Mit dem Ausweg antwortete es korrekt „unklar“.
  • Die Antwort wird gegen deine Liste geprüft. Erfindet das Modell etwas Eigenes oder redet es mehrdeutig („kampf oder menü“), geht es nach unklar. Es geht nie irgendwohin, nur weil ein Wort ungefähr passt.

Hänge an unklar am besten ein kurzes Warten und einen erneuten Versuch — nicht dieselbe Aktion wie an einen Wahl-Ausgang. „Ich weiß es nicht“ ist eine nützliche Antwort, wenn der Bot sie respektiert.

Schritt 4 — Mehrere Werte in einem Aufruf

Für Zahlen und Namen nimm Werte aus Bild lesen. Je Zeile ein Feldname:

gold
level
gegnername

Jedes Feld wird ein gleichnamiger Daten-Ausgang. Das ist ein Aufruf für drei Werte — mit „Bild fragen“ wären es drei.

Benenne die Felder so, wie du es einem Menschen sagen würdest: gold ist klar, wert1 nicht. Das Modell liest, was der Name nahelegt. Steht der Wert an einer ungewöhnlichen Stelle, hilft der Zusatz-Hinweis: „Die Zahlen stehen in der oberen Leiste. Den Chat übergehen.“

Der Bereich ist wichtiger als das Modell

Der wirksamste Griff ist nicht das größere Modell, sondern der enge Bereich. Gemessen an einem echten Spiel-Screenshot in 3440×1474, gleiche Frage, gleiches Modell:

Was gefragt wurde Ergebnis
ganzes Fenster, auf 1024 px verkleinert falsch — Werte aus einem anderen Fenster, 4,4 MB ungeskaliert
Ausschnitt um die Werte (750×385) richtig — 54 KB, 0,2 s

Ein enger Bereich ist also gleichzeitig billiger, schneller und genauer. Nimm dir die halbe Minute mit dem Bereichs-Werkzeug; sie spart mehr als jede andere Einstellung.

Was das kostet — und was es dauert

lokal Anbieter (Claude, GPT)
Geld je Frage nichts nach Bildfläche und Textlänge
Dauer 0,2–0,6 s, wenn das Modell im Speicher liegt je nach Leitung, meist 1–3 s
erster Aufruf etwa 15 s, das Modell wird geladen wie gewohnt
Daten bleiben auf dem Rechner Bildausschnitt geht zum Anbieter

Die Ladezeit beim ersten Aufruf ist der Grund für das großzügige Zeitlimit in der Vorgabe. Und weil eine Schleife sonst hundert Aufrufe für dieselbe Frage macht, gibt es „Antwort merken für“: Wird dieselbe Frage zum gleichen Bild gestellt, kommt die gemerkte Antwort. Jede Änderung am Bild gilt als neue Frage.

Wenn es nicht klappt

Was du siehst Woran es meistens liegt
Hinweis „KI ist noch nicht eingerichtet“ am Modul Kein Anbieter-Profil. Knopf KI einrichten… drücken.
„Lokale Modelle suchen“ findet nichts Der Server läuft nicht. Ollama starten, dann erneut suchen.
Der Ablauf geht immer nach unklar Der Bereich zeigt zu viel oder das Falsche. Enger fassen — und prüfen, ob die Möglichkeiten wirklich zum Bild passen.
Der Ablauf geht immer nach fehler Modellname stimmt nicht, oder das Modell kann keine Bilder. Im Profil ein Modell mit vl, vision oder llava im Namen wählen.
Werte werden verwechselt Der Bereich ist zu groß — siehe oben. Der Zusatz-Hinweis hilft zusätzlich.
Die Antwort ist abgeschnitten Antwortlänge im Anbieter-Profil erhöhen (Feld „Maximale Antwortlänge“).
Alles dauert lange Erster Aufruf lädt das Modell. Danach bleibt es im Speicher — mit „Antwort merken“ wird eine Schleife deutlich billiger.

Wie geht es weiter?

  • KI-Module — alle vier Module mit allen Feldern
  • Bilderkennung — wenn eine Vorlage doch reicht: immer die erste Wahl
  • Steuer-API — einen Bot von einer KI wie Claude Code bauen und überwachen lassen

Bereit zum Ausprobieren?

FlowBotCommander ist zum Start kostenlos — ohne Konto.

Kostenlos starten