Документы и фотографии требуют разных конвейеров, но у них общий принцип: оригинал сохраняется, результат содержит происхождение, а сомнительный случай не проходит автоматически. Для Excel и PDF система извлекает таблицы и характеристики, затем связывает каждое поле с листом, строкой или страницей. Для товарного фото она отделяет предмет, меняет фон и проверяет форму, надписи и логотип. Отправка документа или публикация изображения выполняется после review.
Excel: таблица редко начинается правильно
Прайсы содержат служебные строки, объединённые ячейки, разные названия колонок и числа в текстовом формате. Поэтому обработка начинается с поиска заголовка и проверки типов.
workbook
→ определить листы
→ найти строку заголовка
→ сопоставить колонки по смыслу
→ нормализовать единицы и числа
→ сохранить sheet/row provenanceЗначение NaN не считается ценой. Пустая себестоимость и цена ниже себестоимости получают предупреждение.
PDF: сначала определить тип
Native PDF можно читать напрямую. Скан требует OCR или vision. Смешанный документ полезно обрабатывать по страницам, чтобы не потерять таблицу или подпись.
После извлечения модель приводит текст к схеме, а код валидирует обязательные поля. Ответ без ссылки на страницу остаётся черновиком.
Фотография: два разных подхода
Математический композит сохраняет пиксели товара и меняет только окружение. Генеративный перефон пересчитывает изображение и требует более строгого контроля. Для ресейла это принципиально: модель может сгладить дефект или изменить фурнитуру.
Конвейер DOLOROSA:
исходные фото
→ выбрать пригодный кадр
→ если ракурса нет: needs_source_photo
→ сегментация предмета
→ фон, тень и плашки кодом
→ manifest + ready_review
→ сравнение с оригиналом
→ dry-run порядка изображений
→ явное подтверждение публикацииАвтоматический QC
PHOTOBOX разделял математический композит, AI-перефон, креатив и перекраску. Контроль включал:
- сравнение идентичности товара;
- OCR надписей;
- проверку полноты ответа QC;
- бюджетный лимит;
- перевод неопределённого результата в
review.
Неполный ответ проверки не считается успешным. Это важное правило: unknown не превращается в pass.
Ошибки из разработки
Сегментатор портил светлые участки и тонкие детали. Некоторые случаи пришлось перевести на другую модель или ручную обработку. Два тяжёлых процесса одновременно вызывали OOM, поэтому генерацию вынесли в subprocess и ограничили параллелизм.
Повторная публикация могла изменить порядок изображений или записать их второй раз. Добавили dry-run, постоянные маркеры commit и явное подтверждение администратора.
При обработке документов внешние страницы могли быть недоступны из-за captcha. URL без проверенной карточки не становился точным источником.
Как хранить состояние
Для каждой единицы работы нужен manifest:
{
"source_ref": "immutable-original",
"pipeline_version": "versioned",
"result_ref": "candidate",
"checks": ["identity", "ocr", "human_review"],
"publish_allowed": false
}Оригиналы и резервные копии не должны жить только во временном каталоге. Без них невозможно сравнение и откат.
Что можно автоматизировать
Автоматически работают загрузка, извлечение, нормализация, поиск, первичный QC и сборка кандидата. Человек проверяет спорное соответствие товара, коммерческие параметры, дефекты, надписи и финальную публикацию.
Для обработки фото DOLOROSA согласован публичный ориентир $0,10–0,15 за одно изображение. Это не включает весь контур интеграции и review.
Geron Labs может прогнать один обезличенный файл или набор фото и показать manifest, источники и точки ручного решения.