Как научить ИИ-агента анализировать картинки + PDF и выписывать из них текст
Обычные нейросети вроде ChatGPT, Claude и Gemini умеют анализировать картинки и PDF без возможности копирования прямо в чате. То есть вы можете загрузить картинку с текстом, попросить его выписать — нейронка это сделает. А ИИ-агенты по умолчанию так делать не могут. И чтобы научить их распознавать текст/любые объекты на картинках — нужно подключить к ним OCR. В этом гайде на примере n8n я покажу, как это сделать.
Где будем работать
Для работы понадобится no-code конструктор ботов n8n.
Если раньше в нем не работали, сначала изучите наш мини-курс по n8n. Там мы обучаем использовать сервис с нуля:
Научитесь создавать умных помощников в n8n, которые будут автоматически выполнять ваши задачи — отвечать на сообщения, обрабатывать данные и принимать решения без вашего участия.
- Миникурс
- n8n
А теперь к гайду. OCR может пригодится вам в любом агенте и в любой ситуации, поэтому я подготовил 2 наиболее универсальных настройки в одном воркфлоу. Вы сможете скопировать нужную цепочку узлов и перенести в свой проект.
Файл для скачивания лежит в этой папке.
В воркфлоу вы увидите 2 настройки. Верхняя предназначена для подключения OCR к Telegram боту. Это значит, что после настройки вы сможете отправлять картинки/документы в Telegram-бота, чтобы тот сначала их расшифровал, а затем передал на ИИ-агента или отправил расшифрованное сообщение в Telegram. В зависимости от вашей задачи.
Нижняя — для подключения OCR к базе данных. Чтобы вы могли загрузить нужные файлы в гугл папку, а нейронка их расшифровала и перенесла в Supabase.
Как работать с OCR для телеграм бота

Важно! Чтобы подсоединить эту настройку к своим существующим агентам, нужно скопировать все узлы и вставить их в нужный воркфлоу. И в нужном воркфлоу подсоединить узел Telegram Trigger к началу своему бота. А также отсоединить последний узел Telegram и подключить его к ИИ-агенту.

Чтобы все заработало, в ИИ-агенте в блоке Prompt (User Message) нужно добавить формулу
{{ ($json.original_file_caption ? $json.original_file_caption + '\\n\\n' : '') + ($json.fullText || $json.text || '') }}
Единственное, лучше сначала присылать картинку на расшифровку, а затем запрос для расшифровки. Потому что параллельно 2 пути срабатывают не всегда.
А если вы захотите подключить этот OCR шаблон к другим воркфлоу, но не будете знать как — загружайте код своего агента и мой воркфлоу и спрашивайте Gemini 2.5 pro. Нейронка отлично знает n8n и помогает настроить агентов любой сложности.
Как работать с OCR для базы данных

Здесь все проще и настраивать ничего не надо. Достаточно подключить свои Credentials и перенести воркфлоу в своего агента с базой данных (если вы построили своего агента на основе гайда из нашей базы знаний)
Если ваш агент отличается от нашего, можете закинуть мой воркфлоу в Gemini, загрузить свой и спросить, как их соединить.
Важная информация про расшифровку картинок
У Mistral есть 2 модели для расшифроки картинок: Mistral latest и Pixtral. Pixtral расшифровывает картинки лучше и почти не допускает ошибок, но часто добавляет текст от себя. Например, пишет «вот ваш текст» или что-то в этом роде. В случае расшифровки картинок для базы данных это плохо, поэтому лучше использовать Mistral. Но та может ошибиться с расшифровкой, если картинка плохого качества или на ней много текста в разных шрифтах.
Сейчас в моих воркфлоу подключена Pixtral, чтобы подключить Mistral, удалите стрелки от Document misunderstanding и подключите их к Mistral Image OCR.
Сколько стоит расшифровка документов и изображений
На сайте Mistral указаны такие тарифы:
За модель pixtral:
- Input (/M tokens) — $2;
- Output (/M tokens) — $6.
1 миллион токенов — это примерно 3 000 000 – 4 000 000 символов на русском языке. То есть около 1000 страниц A4.
За модель Mistral Latest:
- OCR — $1 / 1000 страниц;
- Annotations — $3 / 1000 страниц.
Но на самом деле с ценообразованием у Mistral все не очень прозрачно. Пока я тестировал настройки для создания этого гайда, у меня не списали ни одного цента и все работало бесплатно. Хотя я загрузил не один десяток картинок и документов на несколько страниц.
Возможно, также будет и у вас.

