群青 · AI時代のビジネス洞察

Together AI オープンソースモデル推論クラウドプラットフォーム

1)トークン課金:サーバーサイド推論において入力・出力トークンごとに課金

MODEL

主要項目

FIELD STAMPS
業界AI・大規模モデル
地域米国
規模中堅企業
チャネルオンライン

📌 背景

2026年にオープンソースの大規模言語モデルが継続的に爆発的普及を見せ、開発者による低コストかつ高性能な推論サービスへの需要が急増。Together AIは200以上のオープンソースモデルを集約し、OpenAI互換APIを提供することで、開発者が自前でGPUクラスターを構築することなくモデルを呼び出せるようにした。2025年にはARR(年間経常収益)が3億ドルを超え、従量課金モデルが収益の成長を牽引している。

👤 ターゲット顧客

大規模推論を行う開発者、トレーニング・微調整を行う開発者、プロダクションレベルのSaaSおよびAIスタートアップ

💰 収益ポイント

1)トークン課金:サーバーサイド推論において入力・出力トークンごとに課金。100万トークンあたりの価格は0.06ドルから4.5ドルまで。2)エンドポイント時間課金:専用推論エンドポイントに対し、トークン量ではなくGPU稼働時間(時間/日/月)で課金。3)クラスターレンタル:トレーニングやカスタム推論のためのGPUクラスターレンタル。オンデマンドまたは最長6ヶ月の長期レンタルで、期間に応じて課金。4)呼び出し拡張:利用量が超過した際の段階的な超過料金、および専用容量の拡張費用。これらは計算リソース項目だが、実際の売上高は未公開。

🧮 コスト構造

GPU調達およびクラスター運用コストが大半を占める。これにはH100やB200などの高性能グラフィックボードの電力、データセンター、保守費用が含まれる。サーバーサイド推論では、マルチテナントスケジューリング、モデルロード、およびアイドル状態のGPUコストも負担する必要がある。

🛡️ 参入障壁

200以上のオープンソースモデルを集約し、OpenAI互換APIを提供することで、開発者の移行コストを低減。サブスクリプションの障壁がない純粋な従量課金モデルに加え、専用GPUとバッチAPIによる50%の割引により、トークン消費量の多い開発者に対してコスト優位性を確立している。

🔑 成功のカギ

  • 200以上のオープンソースモデルを集約し、統一APIを提供
  • 純粋な従量課金モデルにより開発者の試行コストを低減
  • 専用GPUとバッチAPIで大規模顧客のニーズに対応

⚠️ リスク

  • オープンソースモデルのエコシステムが冷え込み、推論需要が低下するリスク
  • クラウド大手との価格競争による粗利益の圧迫
  • GPUの供給不足や価格変動がコストに与える影響

🏢 事例

  • Llama 3.3 70Bのサーバーサイド推論価格は100万トークンあたり1.04ドル
  • 専用GPU H100単体で1時間あたり約6.49ドル
  • バッチAPIの利用でコストを50%削減し、プロダクションレベルのSaaS顧客を誘致

📊 SWOT分析

強み Strengths

  • オープンソースモデルの網羅性が高く、開発者が自前でクラスターを構築する必要がない
  • 純粋な従量課金モデルで参入障壁が低く、ARRは3億ドルを突破
  • 専用GPUとバッチAPIが高並列・低遅延のニーズに対応

弱み Weaknesses

  • オープンソースモデルのエコシステムに依存しており、独自のクローズドソースモデルによる差別化が不足
  • トークン消費量の多い開発者が他のクラウドベンダーへ流出する可能性

機会 Opportunities

  • オープンソースコミュニティの継続的な拡大が推論需要の増加を牽引
  • マルチモーダルモデルやトレーニング・微調整の顧客によるGPU稼働時間収益の拡大

脅威 Threats

  • AWSやGoogle Cloudなどの巨大企業がオープンソース推論クラウドに参入
  • オープンソースモデルの急速な進化に伴い、プラットフォーム側の頻繁なアップデートと適応が必要