Baidu Unlimited-OCR: страница для модели оказалась просто картинкой.
Baidu Unlimited-OCR предлагает нестандартный подход к распознаванию: модель не ищет отдельные буквы, как это делает Tesseract, а берёт страницу целиком, сжимает её в набор визуальных токенов и передаёт языковой модели. Та, в свою очередь, разворачивает токены в структурированный текст.
По сути, это прямой наследник идеи DeepSeek-OCR. Решение пригодится тем, кому нужно распознавать многостраничные документы за один проход или встраивать такое распознавание в код.

