Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

DeepSeek V4 Pro в рейтинге Arena: модель фронтирного уровня!

Arena опубликовала рейтинг DeepSeek V4 Pro. По предварительным оценкам, модель находится на фронтирном уровне и сопоставима с лучшими разработками Anthropic, GLM, Qwen и OpenAI.

Интересный момент связан с AutoEval, на основе которого считали рейтинг. Эта система ранее вызвала скандал из-за замены оценок живых людей моделью-судьёй. Она заметно повышала рейтинг Claude и занижала DeepSeek. Позже Arena объяснила, что это был только тест, и рейтинг пересчитали на оценках живых людей. При этом в тестовом режиме модель-судья, лояльная к Claude, поставила очень высокие оценки DeepSeek V4 Pro.

Это может косвенно указывать на активную дистилляцию из Claude в новой версии DeepSeek V4 Pro. Модель-судья, скорее всего, смотрит на код, поэтому на дистилляцию как на похожий код должна реагировать довольно сильно.

Новый судья Arena уже не выглядит так скандально. Посмотрим, как изменится рейтинг по мере накопления оценок живых пользователей.

Этот пост Вконтакте:

Ещё новости:

Угон цепочек рассуждений у закрытых моделей: неожиданные находки в Claude Code.
Ханс Моравек: к 2028 году машины поумнеют до человеческого уровня.
Технооптимисты против технопессимистов: спор об ИИ и вайб-кодинге в 2026 году.
Google отключила ИИ-редактирование для Google Earth спустя два дня после запуска.
Российский рынок ИИ превысил 316 млрд рублей по итогам 2025 года.
В лондонском метро заработала система распознавания лиц NEC NeoFace M40.
Взлом через демонстрацию экрана в Zoom: уязвимости нашли с помощью ИИ меньше чем за 20 промптов.
Соцсеть X открыла код системы рекомендаций и раскрыла теневые баны!
США легализуют частных кибернаёмников и ИИ-хакеров OpenAI и Anthropic.
Matic Cues: робот-пылесос начал понимать жесты и убирает туда, куда показали.