Большинство задач автоматизации обходится поиском по картинке и распознаванием текста. Иногда не работает ни то, ни другое — картинка каждый раз другая или текста нет вовсе. Здесь и вступают модули ИИ: они оценивают изображение, а не сравнивают его.
Ты перечисляешь возможные состояния — бой, меню, экран загрузки — и поток уходит туда, что видит ИИ. А если уверенности нет, он выбирает выход «неясно», а не угадывает. Ответ всегда сверяется с твоим списком, поэтому своё состояние он придумать не может.
Золото, уровень, имя противника: один вызов, по выходу на значение. Полезно там, где распознавание текста сдаётся — мелкий шрифт, пёстрый фон, числа, нарисованные в картинке.
Этот путь проходит вне приложения: через API управления ассистент вроде Claude Code или Codex может прочитать каталог модулей, написать бота, отдать его на проверку, запустить, прочитать журнал — и даже посмотреть скриншот, чтобы исправить свои ошибки.
Для распознавания на экране достаточно локальной модели на своём компьютере — именно так мы это и проверяли. Приложение само находит запущенный сервер моделей и заранее выбирает модель, умеющую читать изображения.
| Локальная модель | Провайдер (Claude, GPT …) | |
|---|---|---|
| Стоимость вопроса | нет | по площади изображения и длине текста |
| Скорость | 0,2–0,6 с, когда модель загружена; первый вызов занимает около 15 с | обычно 1–3 с, в зависимости от связи |
| Данные | изображение остаётся на компьютере | выбранная область уходит провайдеру |
| Настройка | установить Ollama, скачать модель, нажать «Найти локальные модели» | ввести ключ провайдера |
Одно измерение, которое стоит знать: узкая область побеждает всё окно. При том же скриншоте и том же вопросе уменьшенное полное окно было прочитано неверно, а фрагмент 750×385 нужного места — верно, причём 54 КБ вместо 4,4 МБ.
Не для каждого щелчка. Поиск по картинке занимает миллисекунды и отвечает всегда одинаково; ИИ тратит доли секунды и может ошибиться. Применяй его там, где нужно понимание, а остальное оставь шаблону и распознаванию текста.
И она не снимает ответственности: бот, который щёлкает сам, может щёлкнуть не туда. Страховка — клавиша паники, «сухой» прогон, аварийный стоп — с ИИ нужна ровно так же, как и без него.