Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Бенчмарк SWE-bench удивил: Haiku обходит Opus, GPT-5 mini превосходит Sonnet на 18%.

Новый бенчмарк, оценивающий способности агентов в задачах типа SWE-bench, вызвал бурное обсуждение. Авторы использовали своего минималистичного агента mini-SWE-agent и получили на удивление низкие результаты для большинства моделей. Если бы замеры проводились в нативных средах Codex, Claude Code или в более умных скаффолдах с поддержкой сжатия контекста, показатели наверняка были бы выше нуля.

Особенно показательной стала статистика воспроизведения популярной задачи SQLite. Второе место заняла Haiku, которая обошла Opus 4.6. Третье место у GPT-5 mini, закрывшей на 18% больше тестов, чем Sonnet 4.6.

Хотя речь идёт лишь об одной задаче, в ней сотни тестов. Столь экстремально низкий балл Opus вряд ли объясняется случайностью. Либо в инфраструктуре или параметрах были допущены ошибки, либо повлияли другие факторы.

Мы ожидаем, что в ближайшую неделю одна из компаний выполнит прогон в Codex, Claude Code или Pi и продемонстрирует ненулевой результат. Решить 80% бенчмарка это не позволит, но 10–15% выглядит достижимым. Ещё более вероятен успех в категории almost solved, где порог пройденных тестов составляет 95%.

Пользователь X прогнал одну из задач с разными настройками Codex и на GPT-5.4/5.5. Результат авторов оказался самым низким с большим отрывом. Также он запустил другую задачу 5 раз в среде Pi, и каждый раз оценка превышала 90%, а в двух случаях достигала 100%.

Остаётся ждать, пока кто-то выделит около десяти тысяч долларов на полноценные прогоны, и следить за новыми релизами. Кстати, свежую модель от Anthropic мы надеемся увидеть уже сегодня.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.