Провайдерам инференса
TokenDock — шлюз между владельцами GPU и потребителями из России. Если у вас есть свободные мощности или собственный инференс-сервис, их можно подключить к общему каталогу.
Что вы получаете
Своих дата-центров у нас нет. Инфраструктура TokenDock открыта для любого владельца оборудования, готового работать с потребителями из России.
Трафик потребителей из РФ
Спрос уже собран: разработчики, продуктовые команды и компании, которые платят рублями и не могут работать с зарубежными провайдерами напрямую. Нагрузка приходит без вашего отдела продаж и без маркетинга на российском рынке.
Биллинг и поддержка на нашей стороне
Мы принимаем оплату, считаем токены, выставляем закрывающие документы и разбираем обращения первой линии. К вам приходит агрегированный трафик и один отчёт по потреблению за период.
Цену и мощности задаёте вы
Прайс за 1M токенов и доступный объём вы определяете сами и меняете, когда нужно. Часть капасити можно закрыть под свои задачи, а модель — временно снять с публикации.
Как подключиться
От первого письма до трафика в каталоге — четыре шага, обычно две-три недели.
- 01
Заявка и созвон
Пришлите форму: какое железо, какие модели, где стоит площадка и какая цена за 1M токенов вас устраивает. На созвоне за полчаса сверяем, что вы отдаёте и что нужно нам — дальше работа идёт с инженером, а не с менеджером.
- 02
Тестовый контур и прогон нагрузки
Подключаем ваш эндпоинт в изолированный контур без клиентского трафика и гоняем синтетику: TTFT, скорость генерации, поведение под параллельными запросами, корректность streaming и кодов ошибок. Отчёт присылаем целиком, включая то, что нам не понравилось.
- 03
Договор
Фиксируем цену, заявленный объём, окно техобслуживания, порядок расчётов и обращение с данными клиентов. Договор заключается с российским юрлицом — ООО «ТОРНАДО», расчёты в рублях.
- 04
Включение в каталог
Модели появляются в каталоге под вашим прайсом и заявленными лимитами. Метрики качества доступны вам с первого дня — в том же виде, в каком их видим мы.
Технические требования
Список короткий и жёсткий — он описывает ровно то, что клиент видит как качество ответа. Всё остальное остаётся на вашей стороне: стек инференса, модель железа и способ шедулинга нас не касаются.
- Протокол
- OpenAI-compatible chat completions с привычной схемой запроса и ответа, плюс список моделей. Нестандартный API подключаем через адаптер на нашей стороне — понадобится описание схемы и тестовый ключ.
POST /v1/chat/completions - Streaming
- SSE обязателен: инкрементальные chunk-и с delta и финальный маркер. Ответ не буферизуется целиком, соединение держится до конца генерации.
text/event-stream - Доступность
- От 99.5% в месяц по каждой модели. Плановые работы — с уведомлением минимум за 48 часов: окно должно быть известно заранее, а не обнаруживаться по ошибкам.
99.5% - Таймауты
- TTFT до 5 с на коротком промпте, общий таймаут запроса не меньше 300 с. Разрыв соединения в середине генерации считается ошибкой запроса и попадает в метрики.
TTFT 5s · timeout 300s - Метрики
- В каждом ответе — блок usage с числом токенов промпта и генерации. На нашей стороне по каждой модели считаются TTFT p50 и p95, токенов в секунду, доля ошибок 5xx и доля таймаутов.
usage.completion_tokens - Лимиты
- Заявленные RPM и TPM по каждой модели плюс потолок параллельных сессий. Превышение отдавайте кодом ответа с заголовком повтора — молчаливая очередь хуже честного отказа.
429 + Retry-After - Сетевой доступ
- HTTPS с валидным сертификатом, публичный адрес или туннель до нашего шлюза. Аутентификация по bearer-токену; доступ можно ограничить списком наших исходящих адресов.
Authorization: Bearer - Описание моделей
- Точный id модели, размер контекста, поддержка function calling, JSON mode и vision. Если чего-то нет — каталог помечает это заранее, чтобы клиент не узнавал об ограничении из ошибки.
Не проходите по одному пункту — это ещё не отказ. Напишите нам: часть требований обсуждаема, часть закрывается адаптером на нашей стороне.
На чём договариваемся
Типового тарифа и готовой схемы подключения нет — условия обсуждаются индивидуально и фиксируются договором. Ниже то, что не меняется от площадки к площадке.
Цену и лимиты задаёте вы
Прайс за 1M токенов, доступные RPM и TPM по каждой модели и потолок параллельных сессий — ваши значения. Меняются в любой момент, применяются без простоя и не пересматриваются нами в одностороннем порядке.
Что фиксирует договор
Заявленный объём, окно техобслуживания, порядок расчётов и обращение с данными клиентов. Всё, о чём договорились, попадает в текст договора, а не остаётся в переписке.
Как считается качество
По каждой модели: TTFT p50 и p95, токенов в секунду, доля 5xx и таймаутов, доля оборванных и пустых ответов. Окно отчётности — 30 дней. Сводка по своим моделям доступна вам.
Запрос уходит без изменений
Мы не подменяем модель на более дешёвую, не режем контекст и не переписываем параметры запроса. К вам приходит ровно то, что прислал клиент. Ваши мощности не перепродаются другим шлюзам — трафик идёт только от нас.
Ваш эндпоинт за общим API
Клиенты работают с одним OpenAI-совместимым интерфейсом — менять интеграцию на их стороне не нужно.
Что спрашивают провайдеры
Если вопроса нет в списке — напишите на почту, ответим тем же текстом, что попадёт в договор.
Кто платит за трафик и как проходят деньги?
Клиент платит TokenDock в рублях, TokenDock платит вам по договору. Вы не работаете с розничными платежами, не выставляете счета конечным пользователям и не несёте риски по возвратам.
Как считается выручка?
По токенам, которые вы вернули в блоке usage, и вашему прайсу за 1M токенов. В конце периода сверяем наши логи с вашими: расхождение сверх допустимого разбираем до выплаты. Отчёт приходит с разбивкой по моделям и дням.
Можно ли ограничить объём?
Да. RPM, TPM и потолок параллельных сессий задаются по каждой модели и меняются в любой момент — новые значения применяются без простоя. Модель можно снять с публикации, штрафов за это нет.
Что с приватностью данных?
Промпты и ответы принадлежат клиенту. Их нельзя использовать для обучения, перепродажи или аналитики за пределами технических логов. Срок хранения логов и порядок удаления фиксируются в договоре.
Нужно ли своё юрлицо?
Для расчётов — да: нужен договор с юрлицом или ИП и реквизиты для акта. С нашей стороны договор заключает ООО «ТОРНАДО», ИНН 7726457664, оплата в рублях по счёту.
Подойдёт ли небольшая площадка на несколько GPU?
Да, минимального объёма нет — есть требования к стабильности: заявленные лимиты должны выдерживаться, а работы объявляться заранее. Небольшой пул проще подключить на одну-две модели, где вы уверены в цене и стабильности.
Подключить мощности
Заявку разбирает инженер, а не отдел продаж. Чем конкретнее описание площадки, тем быстрее дойдём до тестового контура.
Заявка принята
Инженер посмотрит конфигурацию и вернётся с вопросами и датой созвона — обычно в течение одного рабочего дня.
Заявка не ушла
Что-то пошло не так на нашей стороне. Попробуйте ещё раз или напишите напрямую в поддержку.