Алексей Верещагин

Промокоды из картинок: как OCR находит то, что люди пропускают

Часть каналов публикует промокоды прямо в тексте — их легко собрать парсером. Но значительная доля акций приходит в виде картинок: код нарисован или вставлен картинкой.

Решается это распознаванием текста (OCR): каждое изображение из источника прогоняется через распознавалку, из результата вытаскивается код по правилам — длина, формат, стоп-слова.

Главная сложность — не распознать, а отфильтровать: чтобы в базу не попадали «коды» из рекламы конкурентов или случайные наборы символов. Поэтому у каждого кода проверяется контекст и источник.

Итог — агрегатор, который находит акции, которые большинство подписчиков вручную бы не увидели.

Есть похожая задача? Обсудим.

Написать в Telegram