Роберт Мартин обновил подход к ИИ-агентам: один вместо шести.
Роберт Мартин, инженер-ветеран, соавтор Agile-манифеста и автор книги Clean Code, обновил свой подход к работе с ИИ-агентами. Летом он рассказывал, что больше не вычитывает ИИ-код построчно: человеческая медлительность съедает ускорение от нейросетей. Тогда он выстроил рой из шести агентов, которые делили постановку задачи, написание кода и проверки, а сам согласовывал задачу и принимал результат.
Теперь Мартин отмечает, что пока он полировал систему, необходимость в столь жестком управлении в большинстве случаев отпала. Значительную задачу можно поручить одному агенту с несколькими указаниями и вернуться через 40 минут. Обычно хватает пары доработок.
Что пришло на смену рою
- Мартин полюбил спорить с Grok и Codex по поводу своих новых проектов и признает, что иногда принимает их аргументы.
- Фирменная «полоса препятствий» никуда не делась: написанный с помощью ИИ код он по-прежнему обкладывает серией тестов.
Под результатом работы всё равно стоит «подпись» Мартина. Это главная человеческая роль: даже качественный ИИ-результат может оказаться плохим. Саймон Уиллисон рассказывал об опыте создания игры с помощью Claude Fable 5. Модель очень старалась, предусмотрела много мелочей и сделала игру, которая с технической стороны не имела серьезных проблем, но была просто скучной.
Правило шести месяцев
Когда мы начинали работать с ИИ, появилось правило шести месяцев: если человек говорит, что нейронка с чем-то не справилась, нужно спросить, давно ли он пробовал. Прошло полгода: стоит повторить. Позже срок сократился до трех месяцев, а теперь меняется суть: если полгода назад было освоено что-то с ИИ, стоит проверить, не устарели ли приёмы. Возможно, новые модели делают это проще и лучше.
Ещё один пример касается саммари. Мы до сих пор по привычке советуем коллегам: если диалог с моделью затянулся, стоит сделать саммари и начать новый чат. Если модель выдала важный результат, стоит запустить новый чат и проверить его там, чтобы ИИ не был предвзят из-за проверки собственного результата. Однако сейчас мы всё чаще просим модель перепроверить себя в том же чате и не видим случаев, когда такая проверка была бы поверхностной.
Context rot и Claude Fable 5.1
Для моделей Claude долгое время считалось, что при долгом диалоге они тупеют из-за загрязнения контекста противоречащими сведениями. Популярной стала формула: при 1M контекста целиком его можно использовать только для монолитных текстов или кодовых баз. В остальных случаях стоит останавливаться на 40-50% контекста и думать, как его ужать, иначе модель начнет сильно тупить.
Новый опыт показал иное. В течение дня шла работа вместе с Claude Fable 5.1 над сложным лонгридом: модель постоянно гоняли по тексту, просили проверить, переписать, выполнить поиск и уточнить. Объём контекста достиг 670K токенов, значительно выше рекомендованного порога, но модель не тупила: она отлично ориентировалась в тексте и помнила правки, сделанные в самом начале.
От прежних рекомендаций мы пока не отказываемся, но понимаем, что в ближайшие дни нужно прогнать серию более глубоких тестов и посмотреть, что пишут коллеги. А дальше «дядюшка Боб» наверняка выдаст очередную истину, и что-то снова придется переделывать с нуля.
По следам нового заявления Мартина с помощью GPT-6 обновлён материал о том, как он программирует. Там по-прежнему много полезного: описание тестов из «полосы препятствий» и рассказ о том, как применять подходы Мартина в других интеллектуальных задачах. От самой связки агентов мы бы пока не отказывались: в некоторых задачах она остается полезной, в том числе по словам самого Мартина.

