Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Роберт Мартин обновил подход к ИИ-агентам: один вместо шести.

Роберт Мартин, инженер-ветеран, соавтор Agile-манифеста и автор книги Clean Code, обновил свой подход к работе с ИИ-агентами. Летом он рассказывал, что больше не вычитывает ИИ-код построчно: человеческая медлительность съедает ускорение от нейросетей. Тогда он выстроил рой из шести агентов, которые делили постановку задачи, написание кода и проверки, а сам согласовывал задачу и принимал результат.

Теперь Мартин отмечает, что пока он полировал систему, необходимость в столь жестком управлении в большинстве случаев отпала. Значительную задачу можно поручить одному агенту с несколькими указаниями и вернуться через 40 минут. Обычно хватает пары доработок.

Что пришло на смену рою

  • Мартин полюбил спорить с Grok и Codex по поводу своих новых проектов и признает, что иногда принимает их аргументы.
  • Фирменная «полоса препятствий» никуда не делась: написанный с помощью ИИ код он по-прежнему обкладывает серией тестов.

Под результатом работы всё равно стоит «подпись» Мартина. Это главная человеческая роль: даже качественный ИИ-результат может оказаться плохим. Саймон Уиллисон рассказывал об опыте создания игры с помощью Claude Fable 5. Модель очень старалась, предусмотрела много мелочей и сделала игру, которая с технической стороны не имела серьезных проблем, но была просто скучной.

Правило шести месяцев

Когда мы начинали работать с ИИ, появилось правило шести месяцев: если человек говорит, что нейронка с чем-то не справилась, нужно спросить, давно ли он пробовал. Прошло полгода: стоит повторить. Позже срок сократился до трех месяцев, а теперь меняется суть: если полгода назад было освоено что-то с ИИ, стоит проверить, не устарели ли приёмы. Возможно, новые модели делают это проще и лучше.

Ещё один пример касается саммари. Мы до сих пор по привычке советуем коллегам: если диалог с моделью затянулся, стоит сделать саммари и начать новый чат. Если модель выдала важный результат, стоит запустить новый чат и проверить его там, чтобы ИИ не был предвзят из-за проверки собственного результата. Однако сейчас мы всё чаще просим модель перепроверить себя в том же чате и не видим случаев, когда такая проверка была бы поверхностной.

Context rot и Claude Fable 5.1

Для моделей Claude долгое время считалось, что при долгом диалоге они тупеют из-за загрязнения контекста противоречащими сведениями. Популярной стала формула: при 1M контекста целиком его можно использовать только для монолитных текстов или кодовых баз. В остальных случаях стоит останавливаться на 40-50% контекста и думать, как его ужать, иначе модель начнет сильно тупить.

Новый опыт показал иное. В течение дня шла работа вместе с Claude Fable 5.1 над сложным лонгридом: модель постоянно гоняли по тексту, просили проверить, переписать, выполнить поиск и уточнить. Объём контекста достиг 670K токенов, значительно выше рекомендованного порога, но модель не тупила: она отлично ориентировалась в тексте и помнила правки, сделанные в самом начале.

От прежних рекомендаций мы пока не отказываемся, но понимаем, что в ближайшие дни нужно прогнать серию более глубоких тестов и посмотреть, что пишут коллеги. А дальше «дядюшка Боб» наверняка выдаст очередную истину, и что-то снова придется переделывать с нуля.

По следам нового заявления Мартина с помощью GPT-6 обновлён материал о том, как он программирует. Там по-прежнему много полезного: описание тестов из «полосы препятствий» и рассказ о том, как применять подходы Мартина в других интеллектуальных задачах. От самой связки агентов мы бы пока не отказывались: в некоторых задачах она остается полезной, в том числе по словам самого Мартина.

Этот пост Вконтакте:

Ещё новости:

Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.
GuppyLM: языковая модель на 9 млн параметров обучается с нуля за пять минут.