AI/大模型中
← 贴纸墙
JOURNEY · DETAIL
DeepSeek:量化私募幻方用显卡储备孵化的低成本开源大模型黑马
创办:梁文锋 · 杭州深度求索人工智能基础技术研究有限公司
JOURNEY
关键字段
FIELD STAMPSINDUSTRY 行业AI/大模型
REGION 地区中
SCALE 规模巨头
CHANNEL 渠道其他
起步缘由
梁文锋1985年生于广东湛江,浙江大学信息与电子工程硕士,2015年创立量化私募幻方量化,靠机器学习做高频交易起家。为提升量化策略,幻方2019年起囤积上万张英伟达GPU(A100等),最高峰时被称为国内少数拥有万卡集群的机构之一。2023年在大模型浪潮下,梁文锋把部分显卡、人才与资金切出来成立DeepSeek,定位做通用人工智能基础研究,不靠外部融资、不急于商业化的三不原则开局。
发家里程碑
2015年
幻方量化创立 PMF
2015年,梁文锋与浙大校友徐进等人在杭州创立幻方量化(九章资产),用机器学习与高频交易切入量化私募,2019年管理规模突破百亿人民币、2021年前后一度站上千亿规模,成为后来DeepSeek全部算力与资金的输血母体。
2021年
萤火超算囤卡 转折
幻方先后投入萤火一号、萤火二号AI超算,2021年披露萤火二号搭载约一万张英伟达A100,耗资约十亿元。当时这被外界嘲笑为私募不务正业,但正是这批显卡让DeepSeek在2022年美国对华芯片管制后仍手握训练大模型的入场券。
2023年
DeepSeek成立 拐点
梁文锋正式注册杭州深度求索,从幻方抽调工程师组建纯研究团队,坚持不拿外部VC的钱、不做ToB项目堆砌、不追短期营收。公司初期完全靠幻方利润供血,业内估算幻方每年为其投入数亿元研发经费。
2024年
DeepSeek-V2发布引发价格战 增长
DeepSeek发布MoE架构模型V2,API定价压到每百万token输入1元人民币,仅为当时GPT-4级产品的几十分之一,直接引爆字节豆包、阿里通义、腾讯混元的集体降价,被称为中国大模型价格战的发起者,但公司自身营收极小。
2025年
R1发布震动全球 PMF
2025年1月20日DeepSeek-R1开源发布,推理能力对标OpenAI的o1,官方披露V3基座训练仅耗资约557.6万美元、使用2048张H800训练约两个月。1月27日DeepSeek登上美区AppStore免费榜第一超过ChatGPT,当日英伟达市值单日蒸发约5890亿美元,创美股史上最大单日个股跌幅纪录。
2025年
母公司业绩反噬 失败
据虎嗅等报道,梁文锋把幻方量化部分利润回吐用于支持DeepSeek研发,幻方旗下多只量化产品2025年内收益转负,分红与规模承压,用主业利润供养前沿研究的模式第一次显露出可持续性问题,内部关于是否开放融资的争论公开化。
2026年
首次对外融资与IPO传闻 转折
2026年,多家媒体报道DeepSeek启动约500亿元级首轮融资,腾讯、京东等巨头被传入局,估值讨论在4000亿至4800亿元区间,并传出冲刺A股IPO的消息。长期坚持零融资的梁文锋被曝自掏约200亿元保持控股权,从零融资到千亿IPO成为其发展史上最大姿态转变。
转折点
- 2021年幻方顶着嘲讽囤下约一万张A100,意外成为DeepSeek后来绕开芯片管制的最大底牌。
- 2025年1月R1开源发布并登顶美区AppStore,一天之内让英伟达市值蒸发约5890亿美元。
- 2026年从零融资转向接受约500亿级外部融资并传出IPO,标志纯粹研究室模式向资本化让位。
失败与踩坑
- 早期幻方被业内嘲笑私募买卡不务正业,萤火超算投入约十亿元多年看不到商业回报。
- 2025年为输血研发梁文锋回吐幻方利润,旗下多只量化产品年内收益转负,主业造血能力受损。
- V2发起的价格战把API价格打到每百万token一元人民币,行业集体降价后DeepSeek自身几乎没有造血型收入。
- 走红后模型服务频繁被挤爆,API曾暂停充值,暴露出推理算力储备远跟不上用户增长。
关键成功要素
- 背靠幻方量化的利润与约万张A100集群,起步时不依赖外部资本也不欠投资人增长承诺。
- 用MoE架构、MLA注意力等工程创新把训练成本压到美国同行的零头,以效率对冲芯片管制。
- 坚持开源权重,把品牌影响力建立在HuggingFace下载与开发者口碑上而不是广告投放。
- 团队以本土年轻博士为主、扁平管理,梁文锋亲自参与研究环节保持技术判断力。
- 在融资上极度克制,先靠三不原则维持纯粹性,等到身位确立后才以一己出价数百亿的强势姿态引入资本。
经验教训
- 副业式的基础设施投入在风口切换时可能变成核心护城河,囤卡的笑话五年后变成千亿估值的基石。
- 价格战能瞬间打穿行业,但发起者自己也要有母公司输血,否则低价是一把先伤己的刀。
- 开源是资源弱势方建立全球声望最快的杠杆,一次登顶AppStore胜过数年品牌营销预算。
- 纯粹研究模式有保质期,当推理算力成本指数级上升,再傲娇的团队也要向资本市场开口。
- 保持控权比拿钱更重要,梁文锋宁愿自己出资两百亿也不让外部资本主导董事会。
核心数据
- 基座模型训练成本:约557.6万美元(公开资料口径,未验独立复核)
- 训练显卡配置:2048张H800约两个月(公开资料口径,未验独立复核)
- 萤火二号显卡数量:约10000张(公开资料口径,未验独立复核)
- 2026年首轮融资规模:约500亿元人民币(公开资料口径,未验独立复核)
- 估值讨论区间:约4000亿至4800亿元人民币(公开资料口径,未验独立复核)
- 模型接口定价:每百万token输入1元人民币(公开资料口径,未验独立复核)
- 发布日英伟达市值蒸发:约5890亿美元(公开资料口径,未验独立复核)
竞争对手 / 同行
国内对标阿里通义千问、字节豆包、月之暗面Kimi与智谱AI:通义走开源全家桶加云变现路线,豆包靠字节流量做C端应用,Kimi主打长文本并拿了阿里大额投资,智谱走政企ToG路线并已冲刺上市;海外对标OpenAI与Anthropic,两者分别以数千亿美元级估值和数百亿美元年营收目标狂奔,DeepSeek以开源加极低成本在它们的价格体系下方撕开缺口,但商业化收入远小于所有一线对手。
来源
- https://www.huxiu.com/article/4880839.html
- https://www.163.com/dy/article/L03HMTP30531CXC9.html
- https://www.toutiao.com/article/7652567027026870824/
- https://www.ofweek.com/ai/2026-06/ART-201721-12008-30691104.html
- https://iot.ofweek.com/2026-07/ART-132215-12003-30695371.html
- https://www.36kr.com/p/3845593292044928
- https://www.jinse.com.cn/blockchain/3732755.html