Локальный ИИ против облака: считаем деньги
4 мин · ИИ
Вопрос «а куда уйдут наши данные» звучит в первые пять минут почти каждого разговора про внедрение ИИ. Ответ «в облако, но там всё безопасно» устраивает не всех: у банков, медицины и госсектора за спиной стоит служба безопасности, у которой своё мнение.
Локальная модель снимает вопрос механически — данные не покидают контур. Но у неё есть цена, и разговор быстро упирается в неё. Давайте посчитаем.
Из чего складывается стоимость облака
Облачные модели тарифицируются за токены — примерно за части слов. Считать удобно от задачи, а не от токенов.
Возьмём разбор входящих заявок: на каждую уходит текст обращения, кусок инструкции и ответ модели. В среднем это две-три тысячи токенов на заявку. При тысяче заявок в месяц получается два-три миллиона токенов — сумма выходит небольшая, порядка десятков долларов.
Картина меняется, когда задача массовая. Классификация всех входящих сообщений, обогащение базы, скоринг резюме потоком, разбор записей звонков — здесь счёт идёт на десятки и сотни миллионов токенов в месяц, и это уже ощутимые деньги каждый месяц, без конца.
Из чего складывается стоимость своего железа
Разовая покупка плюс электричество.
Ключевой параметр — объём видеопамяти, он определяет, какая модель вообще влезет. Практический ориентир: модель на 7–8 миллиардов параметров в квантованном виде помещается в 6 ГБ видеопамяти. Это уровень видеокарты, которая уже может стоять в офисном компьютере.
Мы это считали не по статьям. У нас есть собственная разработка — локальный ИИ-воркер,
который забирает отложенные задачи и прогоняет их на своём железе. Первый этап там сделан
на Qwen2.5-7B-Instruct в квантовании Q4, и работает он на RTX 2060 с шестью гигабайтами.
Дальше интереснее. Модели вида MoE — где на каждый запрос активируется лишь часть весов — позволяют взять модель на тридцать миллиардов параметров и получить около тридцати токенов в секунду на той же 2060, если добрать оперативной памяти до 64 ГБ. Апгрейд памяти стоит несопоставимо меньше новой видеокарты.
Где проходит граница
Простое правило: облако выгоднее, пока объём небольшой и непредсказуемый. Своё железо выгоднее, когда нагрузка ровная и её много.
Локальный вариант обычно оправдан, когда:
- задача массовая и однотипная — классификация, извлечение полей, скоринг
- нагрузка терпит задержку: не «ответить клиенту за секунду», а «разобрать за ночь»
- данные нельзя отдавать наружу по закону или по требованию службы безопасности
- объём стабилен и понятен — тогда точку окупаемости можно посчитать заранее
Облако обычно оправдано, когда:
- объём небольшой или скачет
- нужны сложные рассуждения, где качество модели решает
- задача разовая и проверяется гипотеза
- нет человека, готового обслуживать железо
Про латентность, о которой забывают
Отдельно стоит сказать про то, что в расчёты обычно не попадает. Локальная модель на скромной видеокарте отвечает медленнее облачной. Для ночной пакетной обработки это безразлично, для живого чата с клиентом — заметно.
Поэтому чаще всего выигрывает не «всё локально» и не «всё в облаке», а гибрид: массовое и терпимое к задержке считается на своём железе, редкое и требовательное уходит в облако. Так себестоимость падает, а качество там, где оно видно клиенту, не страдает.
Как посчитать под себя
Нужны три числа, и все три обычно уже есть:
- Сколько запросов в месяц — из статистики того процесса, который автоматизируете
- Сколько текста в одном запросе — примерно, по паре типичных примеров
- Терпит ли задача задержку — это решает, нужна ли дорогая видеокарта
Дальше арифметика простая: месячная стоимость облака против разовой стоимости железа. Если железо окупается быстрее чем за год — обычно берут его.
Мы делаем такой расчёт бесплатно и говорим прямо, когда локальный вариант не нужен: бывает и так, что при текущих объёмах покупка железа окупится через пять лет, и честнее это сказать сразу.
Подробнее про то, как мы разворачиваем модель внутри вашего контура — на странице ИИ на вашем сервере. Если сначала нужно понять, где вообще ИИ окупится в вашем бизнесе, есть отдельный разбор с цифрами.
Если задача не в железе, а в том, чтобы ассистент отвечал клиентам и искал по вашим документам — это здесь.