Иногда выбор AI-системы влияет на результат сильнее, чем выбор модели.
В свежем разборе coding agents одна и та же модель показывала очень разный результат в разных агентских оболочках. Ещё интереснее, что лидер для большой модели не обязательно оставался лидером для маленькой.
Для руководителя здесь важен не очередной рейтинг. В реальном процессе результат создаёт вся система: контекст, инструменты, правила проверки, ограничения и цена ошибки. Оценивать будущий результат только по названию модели — примерно как судить об эффективности отдела продаж только по тому, какая CRM в нём используется.
Поэтому мне ближе тест на собственном сценарии: одинаковая задача, одинаковые критерии приёмки, полная стоимость результата. Иногда более скромная технология в подходящем процессе оказывается сильнее дорогой и модной.
Источник: https://t.me/tsingular/8086
