Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Анализ логов показал снижение производительности модели Claude Code.

Senior AI Director из AMD проанализировала 6 852 сессии Claude Code за период с января по март. Результаты исследования указывают на заметное ухудшение характеристик модели.

Медианная длина рассуждений модели сократилась примерно с 2200 до 600 символов, что негативно отразилось на качестве принимаемых решений.

Параллельно зафиксирован резкий рост количества API-запросов — почти в 80 раз с февраля на март. Это свидетельствует о том, что модель проводит меньше анализа, совершая больше попыток и повторных запусков.

Изменения коснулись и поведения Claude. Модель стала чаще прекращать выполнение задач или запрашивать подтверждение на продолжение работы. За 17 дней таких случаев было зафиксировано 173, тогда как до 8 марта их не наблюдалось.

Также отмечено падение показателя «reads-per-edit», который отражает, сколько файлов или участков кода модель изучает перед внесением правок. Значение упало с 6.6 до 2.0.

В работе модели участились внутренние противоречия, когда Claude меняет свою позицию по ходу генерации ответа.

Пользователи сообщают, что Claude начал игнорировать важные контекстные файлы, такие как CLAUDE.md. По мнению исследователей, у модели может не хватать «бюджета мышления» для учёта подобных инструкций.

Интересно, что обнаружена зависимость качества работы от времени суток. Наихудшие результаты наблюдаются с 5 до 7 вечера по тихоокеанскому времени, тогда как ночью качество заметно выше. Эта корреляция может быть связана с загрузкой вычислительных ресурсов.

Представители Anthropic ознакомились с выводами исследования. Детали их ответа можно изучить в официальном обсуждении на GitHub.

Несмотря на выявленные проблемы, Claude Code остаётся мощным инструментом, однако его поведение стало менее стабильным и сильно зависит от текущей нагрузки.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.