← 贴纸墙 MODEL · DETAIL

Together AI开源模型推理云平台

1)Token计费:服务器端推理按输入输出Token分别计费,每百万Token定价从0.06到4.5美元不等

MODEL

关键字段

FIELD STAMPS
INDUSTRY 行业AI/大模型
REGION 地区美
SCALE 规模中型
CHANNEL 渠道线上

📌 背景

开源大模型在2026年持续爆发,开发者对低成本、高性能推理服务需求激增。Together AI聚合200多个开源模型并提供OpenAI兼容API,使开发者无需自建GPU集群即可调用模型。2025年其ARR已超3亿美元,纯消费模式推动收入继续增长。

👤 目标客户

高规模推理开发者、训练微调开发者、生产级SaaS与AI初创公司

💰 盈利点

1)Token计费:服务器端推理按输入输出Token分别计费,每百万Token定价从0.06到4.5美元不等;2)端点包时:专用推理端点按GPU时长(小时/天/月)计费,不按Token量;3)集群租赁:GPU集群租赁用于训练与自定义推理,按需或长租最长6个月,按租期收费;4)调用扩容:用量跑超后按阶梯收超额调用费,另给专属容量报价扩容费,这条算机会项,实际进账尚未披露。

🧮 成本结构

GPU采购与集群运维成本占大头,包括H100、B200等高性能显卡的电力、机房与维护。服务器端推理还需承担多租户调度、模型加载与闲置GPU成本。

🛡️ 护城河

聚合200多个开源模型且提供OpenAI兼容API,降低开发者迁移成本。纯消费模式无订阅门槛,配合专用GPU与批量API50%折扣,对高Token量开发者形成成本优势。

🔑 成功关键

  • 聚合200多个开源模型并提供统一API
  • 纯消费模式降低开发者尝试成本
  • 专用GPU与批量API满足高规模客户

⚠️ 风险

  • 开源模型生态降温导致推理需求下滑
  • 云巨头价格战压缩毛利
  • GPU供应不足或价格波动影响成本

🏢 案例

  • Llama 3.3 70B服务器端推理定价每百万Token 1.04美元
  • 专用GPU H100单卡每小时约6.49美元
  • 批量API可减50%成本吸引生产级SaaS客户

📊 SWOT 分析

优势 Strengths

  • 开源模型覆盖广,开发者无需自建集群
  • 纯消费模式门槛低,ARR已超3亿美元
  • 专用GPU与批量API满足高并发低延迟需求

劣势 Weaknesses

  • 依赖开源模型生态,缺乏自有闭源模型差异化
  • 高Token量开发者可能转向其他云厂商

机会 Opportunities

  • 开源社区持续爆发带动推理需求增长
  • 多模态模型与训练微调客户带来GPU时长收入

威胁 Threats

  • AWS、Google Cloud等巨头下场开源推理云
  • 开源模型快速迭代导致平台需频繁更新适配