Я срезал счёт за ИИ примерно на 75% без потери качества. Вот решение, которое это сделало.

Самый быстрый способ переплатить за ИИ - гонять через самый мощный и самый дорогой вариант вообще всё, включая те скучные 80% работы, с которыми ничуть не хуже справится вариант куда дешевле. Именно так я и делал. А потом срезал месячный счёт за ИИ примерно на три четверти и, что важнее, убедился, что качество удержалось. Никакой магии, никакого хитрого приёма - просто горстка непримечательных решений и одна проверка, которая держала меня в честных рамках. Если вы гоняете ИИ на целую команду, а счёт всё ползёт вверх, вот та часть, которую стоит скопировать.
Если коротко
- Большая часть расходов - премиум-инструмент делал работу, которой премиум не нужен. Я разделил работу на «нужен дорогой вариант» и «не нужен», а потом измерил границу.
- Вариант подешевле - на рутинный объём, премиум - только на сложные случаи. Счёт упал примерно на 75%; качество, проверенное на реальных данных, осталось на месте.
- Риск не в том, чтобы срезать расходы. Риск - срезать их без замера. Вот так качество и проседает незаметно.

Куда на самом деле уходили деньги
Когда я присмотрелся, картина оказалась почти неловкой. Подавляющее большинство моего использования ИИ - простая, повторяющаяся работа с низкими ставками, где ответ редко бывает неочевидным. И всё это шло через самый мощный и самый дорогой вариант, фронтирную модель вроде Claude Opus или GPT-4o, просто потому, что так я настроил в первый же день и больше к этому не возвращался. Это самая частая переплата за ИИ, и она прячется у всех на виду, потому что инструмент работает. Просто это стрельба из пушки по воробьям.
Решение, которое всё и сделало
Я разложил работу по двум корзинам:
- Рутинный объём. Большой поток, низкие ставки, почти никакой двусмысленности. Дешёвый вариант здесь действительно хорош.
- Сложные случаи. Поток поменьше, ставки выше, где ошибка дорого обходится, а ответ часто неочевиден. Тут премиум оправдан.
Потом я перевёл рутинный объём (а это подавляющее большинство) на куда более дешёвый вариант, лёгкую модель вроде Claude Haiku или GPT-4o mini, а премиум оставил только на сложные случаи. В этом и весь манёвр. Счёт упал примерно на три четверти, потому что дорогой инструмент перестал тащить на себе всё и взялся за тот маленький кусок, который его и оправдывал. Падение такое крутое из-за разрыва в цене между ярусами: фронтирная модель может стоить за единицу работы больше чем в десять раз дороже лёгкой.
Шаг, который держал всё в честных рамках
Вот часть, которую большинство при урезании расходов пропускает, и именно она решает. Срезать расходы легко. Срезать их без того, чтобы тихо просадить качество, - вот настоящий навык, и на глаз его не оценить. Дешёвый вариант часто выглядит прилично на очевидных случаях и разваливается на сложных, а это ровно тот провал, который вы не заметите, пока его не заметит клиент или коллега.
Поэтому перед тем как всё переключать, я прогнал дешёвый вариант на куске реальной, неприглаженной работы и сравнил с тем, что было. На рутинном объёме он удержался. На сложных случаях - нет, и именно поэтому они остались на премиуме. Граница была проведена не наугад, а там, где её показал замер. (Если хотите длинную версию о том, почему ваш собственный набор тестов вам про это врёт, это отдельная история.)
Простой способ найти собственную экономию
Чтобы всё это проделать, технарём быть не нужно. Хватает трёх вопросов:
- На что я использую дорогой вариант? Выпишите. Большинство ни разу толком не смотрело.
- Какая часть из этого - рутина с низкими ставками? Вот ваш резерв для экономии, обычно это бо́льшая часть.
- Удержит ли дешёвый вариант эту рутинную работу - проверено на реальных данных? Если да, переводите. Если нет, вы нашли случай, которому премиум действительно нужен.
Экономия живёт в зазоре между «за что мы платим» и «что работе на самом деле нужно». У большинства команд этот зазор огромный, и в него никто не заглядывал, потому что дорогая штука работала. Она работает ровно до того момента, как вы посмотрите на счёт.
Экономия не в том, чтобы использовать меньше ИИ. Она в том, чтобы дорогой ИИ перестал делать дешёвую работу.
Что бы я сделал иначе
Стоило вернуться к этому намного раньше. Я один раз настроил дорогой вариант по умолчанию и оставил его работать на месяцы, считая счёт чем-то фиксированным. А он не был фиксированным: это было решение, которое я принял однажды и больше не пересматривал, а это самый дорогой сорт решений. Теперь я отношусь к вопросу «какой инструмент для какой работы» как к тому, что надо пересматривать по графику. Варианты всё дешевеют и становятся лучше, и тот, что вы выбрали год назад, сегодня почти наверняка уже не тот.
В заголовке стоят 75%, но урок под ним скучнее и ценнее: большая часть переплаты за ИИ - не от того, что ИИ используют слишком много, а от того, что дорогой ИИ делает работу, которой он никогда не был нужен. Точная цифра зависит от вашего набора задач, но форма типична, и у большинства команд перекос сильнее, чем им кажется.
Так что вот вопрос к вашему собственному счёту: какая часть ваших премиум-трат на ИИ делает работу, с которой так же хорошо справился бы вариант подешевле, и когда вы в последний раз это реально проверяли?
Нужно что-то похожее для вашего бизнеса? Посмотрите, как я могу помочь →
Заберите чек-лист «AI Audit Kickoff»
Пятнадцать вопросов, которые стоит задать про свои процессы, прежде чем тратить деньги на ИИ. Тот самый первый час, с которого я начинаю настоящий аудит, одностраничным PDF. Оставьте почту и получите его сразу, плюс изредка письмо, когда напишу что-то стоящее. Без спама, отписка в один клик.