Разработчики из Cursor опубликовали итоги эксперимента, посвященного масштабированию автономных кодинг-агентов. В ходе работы сотни агентов параллельно занимались одним проектом на протяжении нескольких недель, в результате чего было создано более миллиона строк кода. Целью эксперимента было выяснить, возможно ли решить задачи, на выполнение которых командам разработчиков обычно требуется несколько месяцев.
Однако основной проблемой оказалась координация: когда агенты получили равные права и сами распределяли задачи, лишь небольшая группа из двадцати агентов показала эффективность двух-трех. Другие ожидали освобождения ресурсов. Для решения этой проблемы была введена иерархия: планировщики анализируют код и формируют задачи, а исполнители их выполняют.
При тестировании системы агенты на GPT-5.2 были задействованы для создания браузера с нуля, и за неделю они разработали более трех миллионов строк кода. Браузер, хотя и далек от уровня WebKit или Chromium, успешно обрабатывает простые сайты.
Кроме того, GPT-5.2 продемонстрировала лучшие результаты в долгосрочных задачах по сравнению с другими моделями, такими как Opus 4.5. Важным выводом команды стало то, что правильные промпты имеют большее значение, чем выбор модели или архитектуры системы. Масштабирование оказалось успешным, несмотря на некоторые проблемы с длительностью работы агентов.
tasani.ru