ИИ в разработке: где реально ускоряет, а где только кажется
Внедрял ИИ-инструменты и как CTO, и как разработчик. Без восторгов и без отрицания - что показали исследования и какие правила пришлось ввести.
Я внедрял ИИ-инструменты с двух сторон: как CTO - на уровне процессов и бюджета, и как человек, который каждый день пишет код. Поэтому у меня нет ни восторга «оно заменит программистов», ни отрицания «это игрушка».
Начну с неудобного.
Цифры, которые стоит знать
В 2025 году METR провела рандомизированный эксперимент: 16 опытных open-source разработчиков, 246 реальных задач в их же репозиториях, случайным образом с разрешённым или запрещённым ИИ. Разработчики ожидали, что ускорятся процентов на 24. По факту получились на 19% медленнее. И - самое интересное - после эксперимента участники всё равно были уверены, что ИИ их ускорил.
Второй источник - отчёт DORA 2024: рост внедрения ИИ в командах сопровождался ухудшением показателей доставки, в первую очередь стабильности.
Что из этого не следует: «ИИ не работает». Выборка маленькая, задачи специфические - знакомые кодовые базы, где эксперт и так работает на пределе.
Что следует: ощущение ускорения и реальное ускорение - разные вещи. Мерить надо результат, а не впечатления. Поэтому у нас внедрение шло вместе с метриками доставки, а не вместо них.
Где выигрыш настоящий
По моему опыту, стабильно выигрывает то, что легко проверить:
Бойлерплейт. Формы по описанию схемы, типы из JSON, обвязка CRUD, конфиги. Проверяется мгновенно - компилируется и работает или нет.
Незнакомая территория. Регулярка, awk, синтаксис Terraform, редкий API. То, что стоило получаса гугления, стоит минуту.
Тесты на существующий код, особенно граничные случаи, которые лень перечислять руками.
Первый черновик. Не финальный код, а «набросай структуру, я перепишу». Пустой файл психологически дороже плохого черновика, это правда работает.
Разбор чужого легаси. «Объясни, что делает эта функция на 200 строк» экономит реально много времени при погружении в проект.
Рутина ревью: опечатки, забытые await, несогласованные названия - до того, как это увидит человек.
Где проигрывает
Задачи, где сложность в контексте, а не в коде. Почему в этом проекте так странно считается тариф, знает аналитик и три файла в вики, а не модель.
Отладка редких багов. Модель уверенно предложит три правдоподобные причины, и все три будут мимо. Тут работает только методичное сужение.
Архитектура. Модель предложит популярное, а не подходящее. Популярное решение под нетипичное ограничение - источник самых дорогих ошибок, которые я видел.
И вообще всё, что нельзя быстро проверить. Если верификация ответа дороже, чем написать самому, инструмент не экономит время, а перекладывает его на проверку.
Правила, которые я ввёл
Отвечает автор, а не модель. «Я не понял, это сгенерировано» - не оправдание на ревью. Не можешь объяснить строчку - не коммить строчку.
Сгенерированный код проходит те же ворота. Линтер, типы, тесты, ревью. Никаких скидок на «это же просто утилита».
Никаких секретов и клиентских данных в чужие сервисы. Отдельный пункт в стандартах и отдельная договорённость по каждому клиенту. Это не паранойя, это условие в контрактах.
Смотрим на метрики, а не на ощущения. Если после внедрения выросли change failure rate и время на ревью - ускорения не случилось, работа просто переехала на другой этап.
Мой личный критерий такой: ИИ экономит время там, где я знаю, как должен выглядеть правильный ответ, но не хочу его печатать. И теряет время там, где я сам не уверен - потому что тогда я не могу отличить хорошее решение от красиво написанной ерунды.
Что это меняет для разработчика
Ценность съезжает. Писать код руками стало дешевле, а понимать систему, ставить задачу и проверять результат - дороже. Джун с ИИ пишет больше кода, но качество его решений упирается в способность этот код оценить. Так что фундамент - алгоритмы, сеть, браузер, архитектура - стал не менее важным, а более.
Правильная позиция, по-моему, где-то между «запретить» и «заменим команду нейросетью». Инструмент хороший, эффект реальный, но не там, где его ждут, и не автоматически.
Пруфы
- Исследование METR, июль 2025 - те самые −19%
- Отчёт DORA 2024
- Stack Overflow Survey, раздел про ИИ - распространённость и уровень доверия
- Исследование GitHub про Copilot - результат противоположного знака, на синтетической задаче