Как научить ИИ-агента анализировать картинки + PDF и выписывать из них текст

Обычные нейросети вроде ChatGPT, Claude и Gemini умеют анализировать картинки и PDF без возможности копирования прямо в чате. То есть вы можете загрузить картинку с текстом, попросить его выписать — нейронка это сделает. А ИИ-агенты по умолчанию так делать не могут. И чтобы научить их распознавать текст/любые объекты на картинках — нужно подключить к ним OCR. В этом гайде на примере n8n я покажу, как это сделать.

Где будем работать

Для работы понадобится no-code конструктор ботов n8n.

Если раньше в нем не работали, сначала изучите наш мини-курс по n8n. Там мы обучаем использовать сервис с нуля:

Научитесь создавать умных помощников в n8n, которые будут автоматически выполнять ваши задачи — отвечать на сообщения, обрабатывать данные и принимать решения без вашего участия.

  • Миникурс
  • n8n

А теперь к гайду. OCR может пригодится вам в любом агенте и в любой ситуации, поэтому я подготовил 2 наиболее универсальных настройки в одном воркфлоу. Вы сможете скопировать нужную цепочку узлов и перенести в свой проект.

Файл для скачивания лежит в этой папке.

В воркфлоу вы увидите 2 настройки. Верхняя предназначена для подключения OCR к Telegram боту. Это значит, что после настройки вы сможете отправлять картинки/документы в Telegram-бота, чтобы тот сначала их расшифровал, а затем передал на ИИ-агента или отправил расшифрованное сообщение в Telegram. В зависимости от вашей задачи.

Нижняя — для подключения OCR к базе данных. Чтобы вы могли загрузить нужные файлы в гугл папку, а нейронка их расшифровала и перенесла в Supabase.

Как работать с OCR для телеграм бота

Чтобы все заработало, в ИИ-агенте в блоке Prompt (User Message) нужно добавить формулу

{{ ($json.original_file_caption ? $json.original_file_caption + '\\n\\n' : '') + ($json.fullText || $json.text || '') }}

Единственное, лучше сначала присылать картинку на расшифровку, а затем запрос для расшифровки. Потому что параллельно 2 пути срабатывают не всегда.

А если вы захотите подключить этот OCR шаблон к другим воркфлоу, но не будете знать как — загружайте код своего агента и мой воркфлоу и спрашивайте Gemini 2.5 pro. Нейронка отлично знает n8n и помогает настроить агентов любой сложности.

Как работать с OCR для базы данных

Здесь все проще и настраивать ничего не надо. Достаточно подключить свои Credentials и перенести воркфлоу в своего агента с базой данных (если вы построили своего агента на основе гайда из нашей базы знаний)

Если ваш агент отличается от нашего, можете закинуть мой воркфлоу в Gemini, загрузить свой и спросить, как их соединить.

Важная информация про расшифровку картинок

У Mistral есть 2 модели для расшифроки картинок: Mistral latest и Pixtral. Pixtral расшифровывает картинки лучше и почти не допускает ошибок, но часто добавляет текст от себя. Например, пишет «вот ваш текст» или что-то в этом роде. В случае расшифровки картинок для базы данных это плохо, поэтому лучше использовать Mistral. Но та может ошибиться с расшифровкой, если картинка плохого качества или на ней много текста в разных шрифтах.

Сейчас в моих воркфлоу подключена Pixtral, чтобы подключить Mistral, удалите стрелки от Document misunderstanding и подключите их к Mistral Image OCR.

Сколько стоит расшифровка документов и изображений

На сайте Mistral указаны такие тарифы:

За модель pixtral:

  • Input (/M tokens) — $2;
  • Output (/M tokens) — $6.

1 миллион токенов — это примерно 3 000 000 – 4 000 000 символов на русском языке. То есть около 1000 страниц A4.

За модель Mistral Latest:

  • OCR — $1 / 1000 страниц;
  • Annotations  —  $3 / 1000 страниц.

Но на самом деле с ценообразованием у Mistral все не очень прозрачно. Пока я тестировал настройки для создания этого гайда, у меня не списали ни одного цента и все работало бесплатно. Хотя я загрузил не один десяток картинок и документов на несколько страниц. 

Возможно, также будет и у вас.

0 комментариев
Старые
Новые Популярные