Coming Soon

Локальный ИИ против облака: считаем деньги

4 мин · ИИ

Вопрос «а куда уйдут наши данные» звучит в первые пять минут почти каждого разговора про внедрение ИИ. Ответ «в облако, но там всё безопасно» устраивает не всех: у банков, медицины и госсектора за спиной стоит служба безопасности, у которой своё мнение.

Локальная модель снимает вопрос механически — данные не покидают контур. Но у неё есть цена, и разговор быстро упирается в неё. Давайте посчитаем.

Из чего складывается стоимость облака

Облачные модели тарифицируются за токены — примерно за части слов. Считать удобно от задачи, а не от токенов.

Возьмём разбор входящих заявок: на каждую уходит текст обращения, кусок инструкции и ответ модели. В среднем это две-три тысячи токенов на заявку. При тысяче заявок в месяц получается два-три миллиона токенов — сумма выходит небольшая, порядка десятков долларов.

Картина меняется, когда задача массовая. Классификация всех входящих сообщений, обогащение базы, скоринг резюме потоком, разбор записей звонков — здесь счёт идёт на десятки и сотни миллионов токенов в месяц, и это уже ощутимые деньги каждый месяц, без конца.

Из чего складывается стоимость своего железа

Разовая покупка плюс электричество.

Ключевой параметр — объём видеопамяти, он определяет, какая модель вообще влезет. Практический ориентир: модель на 7–8 миллиардов параметров в квантованном виде помещается в 6 ГБ видеопамяти. Это уровень видеокарты, которая уже может стоять в офисном компьютере.

Мы это считали не по статьям. У нас есть собственная разработка — локальный ИИ-воркер, который забирает отложенные задачи и прогоняет их на своём железе. Первый этап там сделан на Qwen2.5-7B-Instruct в квантовании Q4, и работает он на RTX 2060 с шестью гигабайтами.

Дальше интереснее. Модели вида MoE — где на каждый запрос активируется лишь часть весов — позволяют взять модель на тридцать миллиардов параметров и получить около тридцати токенов в секунду на той же 2060, если добрать оперативной памяти до 64 ГБ. Апгрейд памяти стоит несопоставимо меньше новой видеокарты.

Где проходит граница

Простое правило: облако выгоднее, пока объём небольшой и непредсказуемый. Своё железо выгоднее, когда нагрузка ровная и её много.

Локальный вариант обычно оправдан, когда:

Облако обычно оправдано, когда:

Про латентность, о которой забывают

Отдельно стоит сказать про то, что в расчёты обычно не попадает. Локальная модель на скромной видеокарте отвечает медленнее облачной. Для ночной пакетной обработки это безразлично, для живого чата с клиентом — заметно.

Поэтому чаще всего выигрывает не «всё локально» и не «всё в облаке», а гибрид: массовое и терпимое к задержке считается на своём железе, редкое и требовательное уходит в облако. Так себестоимость падает, а качество там, где оно видно клиенту, не страдает.

Как посчитать под себя

Нужны три числа, и все три обычно уже есть:

  1. Сколько запросов в месяц — из статистики того процесса, который автоматизируете
  2. Сколько текста в одном запросе — примерно, по паре типичных примеров
  3. Терпит ли задача задержку — это решает, нужна ли дорогая видеокарта

Дальше арифметика простая: месячная стоимость облака против разовой стоимости железа. Если железо окупается быстрее чем за год — обычно берут его.

Мы делаем такой расчёт бесплатно и говорим прямо, когда локальный вариант не нужен: бывает и так, что при текущих объёмах покупка железа окупится через пять лет, и честнее это сказать сразу.

Подробнее про то, как мы разворачиваем модель внутри вашего контура — на странице ИИ на вашем сервере. Если сначала нужно понять, где вообще ИИ окупится в вашем бизнесе, есть отдельный разбор с цифрами.

Если задача не в железе, а в том, чтобы ассистент отвечал клиентам и искал по вашим документам — это здесь.

Похожие статьи

Как подключить Payme к сайту: пошагово Конструктор или разработка: честное сравнение Как сделать магазин в Telegram