Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Китайские кандзи стали новым бенчмарком для VLLM: проверка на 3000 лет эволюции письменности.

Мы с интересом изучили запуск открытого визуального бенчмарка Chronicles-OCR, предназначенного для оценки того, насколько хорошо мультимодальные модели понимают древние китайские иероглифы.

В чём особенность проверки

Большинство обычных OCR-тестов проверяет, умеет ли модель читать аккуратный современный текст. Chronicles-OCR подходит к задаче иначе. Моделям дают не современные символы из шрифта, а реальные исторические формы письма, охватывающие 3000 лет эволюции.

Состав датасета

  • 7 исторических стилей письма, от гадательных костей до скорописи
  • 2800 сбалансированных изображений
  • Разнообразные физические носители, где символы выглядят совсем не как «чистый OCR»
  • Задачи на поиск символов, распознавание, разбор древнего текста и классификацию стиля письма

Почему это важно

Для мультимодальных моделей такая проверка становится настоящим испытанием. Символ может быть одним и тем же по смыслу, но визуально выглядеть как совершенно другой объект. Chronicles-OCR наглядно показывает, где модель действительно «видит» и понимает трансформацию знака, а где просто пытается угадать по привычным паттернам, не улавливая многовековые изменения в начертании на разных материалах и в разных стилях.

Paper: https://arxiv.org/abs/2605.11960

GitHub: https://github.com/VirtualLUOUCAS/Chronicles-OCR

Этот пост Вконтакте:

Ещё новости:

Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.
GuppyLM: языковая модель на 9 млн параметров обучается с нуля за пять минут.