Together AI オープンソースモデル推論クラウドプラットフォーム
1)トークン課金:サーバーサイド推論において入力・出力トークンごとに課金
主要項目
FIELD STAMPS📌 背景
2026年にオープンソースの大規模言語モデルが継続的に爆発的普及を見せ、開発者による低コストかつ高性能な推論サービスへの需要が急増。Together AIは200以上のオープンソースモデルを集約し、OpenAI互換APIを提供することで、開発者が自前でGPUクラスターを構築することなくモデルを呼び出せるようにした。2025年にはARR(年間経常収益)が3億ドルを超え、従量課金モデルが収益の成長を牽引している。
👤 ターゲット顧客
大規模推論を行う開発者、トレーニング・微調整を行う開発者、プロダクションレベルのSaaSおよびAIスタートアップ
💰 収益ポイント
1)トークン課金:サーバーサイド推論において入力・出力トークンごとに課金。100万トークンあたりの価格は0.06ドルから4.5ドルまで。2)エンドポイント時間課金:専用推論エンドポイントに対し、トークン量ではなくGPU稼働時間(時間/日/月)で課金。3)クラスターレンタル:トレーニングやカスタム推論のためのGPUクラスターレンタル。オンデマンドまたは最長6ヶ月の長期レンタルで、期間に応じて課金。4)呼び出し拡張:利用量が超過した際の段階的な超過料金、および専用容量の拡張費用。これらは計算リソース項目だが、実際の売上高は未公開。
🧮 コスト構造
GPU調達およびクラスター運用コストが大半を占める。これにはH100やB200などの高性能グラフィックボードの電力、データセンター、保守費用が含まれる。サーバーサイド推論では、マルチテナントスケジューリング、モデルロード、およびアイドル状態のGPUコストも負担する必要がある。
🛡️ 参入障壁
200以上のオープンソースモデルを集約し、OpenAI互換APIを提供することで、開発者の移行コストを低減。サブスクリプションの障壁がない純粋な従量課金モデルに加え、専用GPUとバッチAPIによる50%の割引により、トークン消費量の多い開発者に対してコスト優位性を確立している。
🔑 成功のカギ
- 200以上のオープンソースモデルを集約し、統一APIを提供
- 純粋な従量課金モデルにより開発者の試行コストを低減
- 専用GPUとバッチAPIで大規模顧客のニーズに対応
⚠️ リスク
- オープンソースモデルのエコシステムが冷え込み、推論需要が低下するリスク
- クラウド大手との価格競争による粗利益の圧迫
- GPUの供給不足や価格変動がコストに与える影響
🏢 事例
- Llama 3.3 70Bのサーバーサイド推論価格は100万トークンあたり1.04ドル
- 専用GPU H100単体で1時間あたり約6.49ドル
- バッチAPIの利用でコストを50%削減し、プロダクションレベルのSaaS顧客を誘致
📊 SWOT分析
強み Strengths
- オープンソースモデルの網羅性が高く、開発者が自前でクラスターを構築する必要がない
- 純粋な従量課金モデルで参入障壁が低く、ARRは3億ドルを突破
- 専用GPUとバッチAPIが高並列・低遅延のニーズに対応
弱み Weaknesses
- オープンソースモデルのエコシステムに依存しており、独自のクローズドソースモデルによる差別化が不足
- トークン消費量の多い開発者が他のクラウドベンダーへ流出する可能性
機会 Opportunities
- オープンソースコミュニティの継続的な拡大が推論需要の増加を牽引
- マルチモーダルモデルやトレーニング・微調整の顧客によるGPU稼働時間収益の拡大
脅威 Threats
- AWSやGoogle Cloudなどの巨大企業がオープンソース推論クラウドに参入
- オープンソースモデルの急速な進化に伴い、プラットフォーム側の頻繁なアップデートと適応が必要