Три разных продукта
Together предлагает serverless per-token и reserved capacity. Fireworks сочетает per-token serverless и GPU-time dedicated. Groq публикует production/preview каталог с фокусом на latency. Prepaid gateway — отдельный слой с единым кошельком.
Together AI: выбор open-моделей
Together публикует model-specific input, cached и output ставки, а serverless работает без provisioning cost и minimum. Это удобно, если вы сами выбираете модель и ведёте аккаунт.
Fireworks: serverless и dedicated
У Fireworks serverless считается по токенам, а dedicated — по GPU time. При оценке dedicated учитывайте idle/reserved время, а не только per-token headline.
Groq: latency и узкий каталог
Groq даёт таблицы production и preview моделей, а developer-биллинг идёт postpaid с progressive thresholds. Это не multi-provider aggregator.
Пять чисел для проверки
Запишите input/output, cache/reasoning, payment timing, limits и P95 TTFB/stream failure из одинаковых synthetic-тестов. Повторите тест через сутки.
Практический выбор
Прямой provider нужен для native features и capacity, gateway — для простого бюджета, router — для breadth и fallback. Не публикуйте blanket claim «дешевле на 90%» без workload и формулы.