2026年07月24日 星期五
目录

梁文锋在投资者会上说了什么?|万字全文总结

互联网2026-07-23
今天,微信群里流传着一份DeepSeek创始人梁文锋投资者日的PDF文件,疑似AI转录文件。我们针对文件全文做了二次整理,尽可能还原他到底讲了什么。但是需要说明的是,本文按原始文件整理呈现,并未经梁文锋本人及DeepSeek方面确认。 文件标注的音频日期是5月20日,总时长约3小时44分钟。再结合V4的发布时间、融资进度等信息,这场交流应该是发生在20...

1_副本.jpg

  今天,微信群里流传着一份DeepSeek创始人梁文锋投资者日的PDF文件,疑似AI转录文件。我们针对文件全文做了二次整理,尽可能还原他到底讲了什么。但是需要说明的是,本文按原始文件整理呈现,并未经梁文锋本人及DeepSeek方面确认。

2.jpg

  文件标注的音频日期是5月20日,总时长约3小时44分钟。再结合V4的发布时间、融资进度等信息,这场交流应该是发生在2026年,一个月前的4月24日,DeepSeek刚刚发布V4,公司正在首次引入外部资本,补充算力,也准备通过期权稳定团队。

  交流覆盖了投资人关心的商业问题:开源能否赚钱,API如何定价,C端用户有什么价值,B端收入能否覆盖研发,DeepSeek以后会不会上市。技术部分,则围绕Agent之后的持续学习、模型参与下一代模型研发、Scaling空间、中美算力差距和国产芯片适配展开。

  其中还有许多此前很少公开的数字和内部做法。DeepSeek的API价格以十个月收回设备成本。公司当时约有两万张H系列等效算力。如果市场供应允许,2026年采购200亿元算力也可以接受。华为计划提供约1.6万张950芯片。公司一半左右的核心研究员可能在参与数据标注。显卡供应和需求同时增长的条件下,API相关ARR有机会达到数亿美元。

  DeepSeek把AGI作为研发主线,用API、C端和B端业务承接沿途产出的模型能力。公司需要收入,也需要融资,但产品、销售和流量不会占用最多资源,资源和组织注意力会优先投入AGI。

1、开源从愿景开始

  DeepSeek最初的几十个人加入公司时,没有把上市和个人财富回报放在首位。把他们聚在一起的,是对AI价值和AGI目标的共同判断。

  梁文锋二十年前最崇拜的管理者是杰克·韦尔奇。今天再看,韦尔奇的大部分管理主张可能已经过时,但有一点仍然成立:大公司最终靠愿景组织起来。

  愿景没有写进DeepSeek的制度,也没有变成墙上的标语。员工对它的理解可以不同,公司日常的取舍会给出答案。DeepSeek没有KPI,早期也缺少明确的组织架构。许多研究由员工自己发起,管理层依靠共识推动需要全公司协作的任务。

  开源是这种愿景的直接结果。一些公司在竞争压力下开放模型,用来换取市场和生态;DeepSeek从成立之初就把开源放在目标里,最强模型也准备继续开源。

  开源模型与DeepSeek自己部署的版本保持一致。公司不会对外开放一个能力较弱的版本,再把更好的模型留给官方产品。2025年,DeepSeek在C端基本沿用这套做法,没有看到开源服务与官方App发生明显冲突。

  背后的商业判断是,AI市场足够大。假设AI未来占人类社会GDP的10%甚至20%,一家公司无法独占全部价值。过度追求份额会增加合作阻力,也会吸引收费更低、开放程度更高的挑战者。公司拿走一小部分,已经可以形成巨大的商业回报。

  DeepSeek希望把利润维持在合理水平。模型可以开放,公司仍然通过官方API、部署效率和持续迭代获得收入;价格需要覆盖风险与研发,也要让更多人用得起。

2、API价格以十个月收回设备成本

  DeepSeek给API定价时有一条内部参考线:采购一批服务器,大约十个月收回设备成本。财务上,服务器可以按三年或五年摊销;商业上,十个月回本可以覆盖前期投入和风险。

  公司其实还有提价空间。在当前价格区间,用户需求对价格已经不太敏感。价格提高一倍,Token消耗量未必明显下降,公司收入却可能接近翻倍。DeepSeek没有按这个方向定价。

  某个模型上线前,团队担心需求太大,最初把价格定得较高。后来价格降到原来的四分之一,公司群里很多人欢呼。员工花时间提高模型效果和计算效率,希望它能被充分使用。只要设备成本可以在合理周期内收回,他们愿意把效率收益让给用户。

  十个月回本仍然留下了降价空间。进一步降价需要满足一个条件:带来更多需求或更多社会价值。如果现有价格已经覆盖大部分用户,再降价不会明显增加Token用量,公司的收入和用户收益都没有增加。

  低价依赖计算效率。模型权重开放之后,第三方仍要解决推理优化、集群利用率、系统工程和持续运维。许多部署方很难达到DeepSeek的成本。官方API只获取合理利润时,开源不会明显削弱服务收入。

  DeepSeek希望第三方把模型部署起来,也愿意提供复现和优化方面的帮助。第三方部署效果差、推理成本高,会影响用户对模型的判断。更多可用的部署可以扩大模型的使用范围。

  计算效率还决定公司能够训练多大的模型。同样一批卡,效率提高后可以承载更大参数规模和更多实验。美国大公司可以追加资源,DeepSeek首先要从架构、算法和工程中降低每次训练与推理的成本。

3、C端和B端都来自AGI研发的中间产出

  2025年春节前后,DeepSeek的C端用户快速增长。公司没有大笔投入买流量,没有急着变现,也没有把成为下一个字节或腾讯写进计划。团队以较低成本维持服务,大量用户仍然留了下来。

  DeepSeek没有专门为C端做一套模型。团队沿着AGI路线提高模型能力,成熟的阶段性成果进入App和API。模型能力仍然决定主要体验时,研发投入会直接反映到产品上。

  2026年,行业关注从C端流量转向B端收入。如果需求继续扩大,公司又能买到更多显卡,API相关ARR做到几亿美元存在可能。若进一步接近10亿美元,现金流有机会转正,可以覆盖研发和其他费用。

  DeepSeek仍不会为短期B端收入改变研发主线。API只需要少量人员维护,早期甚至没有销售和完整客服。通往AGI的每一代模型都可以对外提供服务,B端收入由此产生。

  C端用户和B端收入都要拿,也会认真服务;AGI带来的市场更大。公司不会为了做大现有业务停下研发。

  这个判断也限制了产品边界。DeepSeek暂时不准备大规模进入广告、电商、本地生活、金融、法律和医疗等垂直业务。模型变化太快,今天设计的商业闭环可能很快失效。通用Coding Agent的优先级更高,因为它可以覆盖大量工作,也能帮助DeepSeek自己的研发。

  视频生成、多模态、搜索和世界模型被放在不同位置。视频生成有商业价值,当前没有进入DeepSeek认定的智能主线。多模态会进入V4及后续版本,作用更接近搜索,是模型需要补齐的组件。世界模型涵盖的范围较宽,当时没有被列为提高智能上限的首要任务。

  更多应用将由合作伙伴完成。DeepSeek集中做基础模型和AGI研究,行业公司负责场景、数据、产品和交易。AI市场可以容纳多家万亿美元级公司,模型公司不需要向每一层垂直整合。

  这种合作也包括其他模型公司。阿里、智谱和月之暗面等竞争者同样可以获得开源复现信息。合作伙伴可以获得更多协助,公开模型的基本方法和边界会对所有人说明。

4、Agent之后,DeepSeek要解决持续学习

  一名员工入职两个月后,已经知道公司里的同事是谁、做什么工作、坐在哪里,也知道该怎么联系。AI若要完成同一件事,需要用户把这些信息重新写入上下文。

  当前模型在指令和上下文完整时,已经能完成大量高难度任务。真实工作很难每次都提供完整背景。员工通过日常交流积累公司知识,模型还缺少稳定、有效的长期学习能力。

  近几年的AI进展可以分成几个台阶。语言模型提供基础能力,思维链让模型通过推理解决更难的问题,Agent让模型调用工具、执行更长的任务。每一级都使用前一级的能力。

  思维链提高了模型在数学和编程上的上限,Agent扩大了任务范围。Agent达到上限后,模型仍然无法像员工一样长期适应环境。DeepSeek把持续学习视为下一个研究重点:模型需要在较长时间里吸收经验,加入新知识时保留旧能力,还要发现自己缺少什么信息。

  这个突破没有明确时间表。全世界都没有找到足够可靠的方法,DeepSeek内部有一些思路,但尚未做通。持续学习也不是一个单独的算法,它会涉及训练、记忆、反馈、评估和系统工程。

  这类研究不一定消耗很多卡。很多研究员都可以尝试,关键想法出现在哪个人、哪个实验里无法提前安排。DeepSeek会把它列为重要问题,给研究员保留思考和试验的时间。

  持续学习之后,模型可以长期参与真实项目,理解过去的实验,积累失败经验,也可以帮助开发下一代模型。AI参与AI研究后,研发速度会逐步加快。这个过程是连续的,速度可能呈现非线性增长。

  具身智能排在更后面。普通人的衣食住行、照护和物理劳动最终需要机器人完成。DeepSeek希望先提高模型的学习和研究能力,再让模型帮助设计具身系统。前面的技术可以降低后续开发的人力投入。

5、下一代模型首先要给DeepSeek自己用

  下一代模型的第一批用户是DeepSeek内部的研究员。它需要帮助他们写代码、分析实验、改进训练流程和开发下一版模型。新模型提高研发效率后,下一轮模型开发可以获得更多AI辅助。

  内部使用的门槛很高。研究员熟悉模型训练,会持续处理长周期、上下文复杂、结果难以验证的问题。模型如果能在这样的环境里产生稳定价值,相关能力也可以提供给外部程序员和企业。

  现阶段,AI主要与人配合,还不能自主完成整套模型研究。持续学习会让它记住项目背景,追踪多轮实验,在数周或数月的研发周期里保持上下文。DeepSeek希望通过这条路径加快AGI研发。

  模型目前已经可以表现出足够的品位和直觉,写文章、写代码和提出方案时都能给出可用选择。长期参与任务的能力更紧缺。

  在产品侧,幻觉可以通过更好的后训练继续改善。它是需要解决的产品问题,但没有放到当前研究路线的最前面。垂直金融、法律、医疗Agent也排在通用Agent之后,Coding Agent的确定性和内部价值更高。

  后训练依赖高质量数据。中国在高端数据标注上没有明显成本优势。复杂的数学、代码和专业数据需要高水平人员判断,美国公司和中国公司承担的成本接近。DeepSeek会增加投入,但资本无法立刻换来成熟的数据生产体系。

  OpenAI和Anthropic开始得更早,已经积累了流程、人员和质量标准。国内公司近半年才明显扩大这部分工作,追赶需要时间。一年左右可能看到国内高质量数据能力的明显改善。

  合成数据也会发挥作用。AlphaGo下出人类棋谱中没有出现过的招法,说明模型可以在既有人类知识上生成新的解法。真实数据与仿真数据如何配合,仍然有多种路线,DeepSeek没有给出固定答案。

6、两万张等效算力,融资后继续买卡

  DeepSeek当时约有两万张H系列等效算力,其中相当一部分在此前一两个月刚到,还有机器尚未交付。公司正在快速扩充集群,采购原则是在价格合理的范围内能买多少就买多少。

  融资将尽快换成GPU。资金放在银行只能获得有限利息,GPU可以用于训练,也可以通过API服务形成现金流。若采购团队能在半年内把计划中的资金花完,进展就很理想。市场供应和价格限制了实际速度。

  如果2026年能够采购200亿元算力,采购部门就算取得了很好的成绩。融资资金会优先补充算力。另一项重要用途是改善员工期权价值,保持核心团队稳定。

  中美AI差距主要来自资源。国内不缺聪明人,算力少会减少实验机会,研究员的经验也因此受限。人才、模型能力和应用成熟度的差异,会受到算力投入的长期影响。

  以激活参数规模估算,美国前沿模型可能已经进入约800B的量级,国内主要还在几十B。训练同等规模模型,可能需要约五万张GB300;换成国产芯片需要更多,而且这只计算一次训练,没有包含前期研究和多轮实验。

  DeepSeek现有资源仍适合在几十B激活参数规模上做更多实验。扩大到150B、250B,需要等待更多算力。公司相信Scaling仍然有效,模型规模、数据和训练投入继续增加,效果还会提高。中国团队距离Scaling上限很远。

  在约50B激活参数的尺度上,DeepSeek可以逐步接近当时领先的开源模型;与美国公司未公开的大尺寸模型仍有明显差距。后一类能力需要150B甚至更大激活规模。乐观情况下,DeepSeek可能在2026年年底开始训练150B级模型,实际时间取决于芯片到货和前期实验。

  公司习惯的发版节奏约为两三个月一版。每次发版继续改善效果、速度和成本,下一代模型则需要持续学习能力带来更大变化。没有持续学习之前,迭代主要发生在模型质量、推理速度和计算效率上。

  资源较少迫使DeepSeek提高效率。过去的追赶方式可以概括为:晚一到两年,用美国公司二十分之一的算力完成相近工作。下一阶段希望把时间差缩短到六个月、三个月,同时获得对手几分之一的算力,在少数方向上率先达到更高水平。

  总算力仍有数量级差距时,DeepSeek不会承诺全面超越。公司会选择重点问题集中投入,接受其他方向和整体模型规模暂时落后。

7、TileLang降低迁移成本,国产芯片仍受制于产能

  国产AI芯片过去面临两项限制:硬件性能和软件生态。企业买到芯片后,还要解决算子、框架、工具链和工程经验,CUDA长期提供了完整环境。

  生态问题正在缓解。AI可以帮助编写和迁移代码,TileLang这类高级语言也降低了高性能算子的开发门槛。DeepSeek公开的TileKernels项目,使用TileLang编写大模型训练和推理所需的GPU算子,部分算子已经用于内部场景。

  TileLang可以用更少代码重写大量底层工作,执行效率损失约1%至2%。同一套关键算子和优化方法也可以迁移到不同硬件平台。DeepSeek会继续在英伟达卡上训练,同时减少关键工作对单一软件生态的依赖。

  DeepSeek当时主要与华为合作,并准备深度参与昇腾生态。950超节点的任务能力有机会平替英伟达GB200、GB300,但需要更多国产卡完成同等任务,芯片代际也落后约两年。

  英伟达卡可以按五年折旧估算,国产卡的经济寿命可能只有三年。更多芯片也会增加电力和系统成本。在高端英伟达卡供应受限的环境里,只要国产系统可以完成任务,价格溢价仍可接受,它就有实际需求。

  产能短期内更难解决。华为计划向DeepSeek提供约1.6万张950,折算后只相当于约4000张B系列芯片,足以支持当前一代模型,无法训练规模更大的下一代模型。

  国产芯片生态的可用性可能在一年内得到验证。模型公司和互联网企业都在做适配,TileLang等工具可以缩短迁移周期。届时,产能和单位成本会取代生态可用性,成为主要问题。

  2026年、2027年和2028年都可能继续受产能影响。五年后,产能有机会明显改善。国产算力需要依次解决生态可用、供应规模和芯片代际三项问题。

  DeepSeek暂时不计划自研芯片。电厂不需要自己制造全部发电设备,只要市场能提供价格合理的产品。上游供应长期无法满足需求时,公司才会重新计算自研芯片的收益。

8、模型公司的差距会落到成本、时间和体验

  大模型能力长期会逐步接近。比较两家模型时,需要把成本放在同一水平上,就像比较同一价位的汽车。无限增加推理预算可以提高效果,对用户和企业有意义的是,在相同价格下能获得多少能力。

  模型公司的长期差距可以归纳为三项:成本、时间和用户体验。

  成本排在第一位。两家公司提供相近质量的服务,训练和推理效率更高的一方可以降低价格,也可以保留更多利润。DeepSeek长期优化模型架构、算子、部署和集群利用率,这些能力不会随模型开源自动转移给第三方。

  时间排在第二位。前沿模型早几个月发布,可以先获得用户、反馈和收入。Anthropic当时在Code Agent上领先,这类优势带有阶段性。DeepSeek内部使用不同产品的人也有分歧,约一半员工仍觉得OpenAI更好。OpenAI、Google和Anthropic很可能交替领先。

  用户体验排在第三位。C端产品会积累习惯和黏性,模型效果、速度、稳定性、工具调用和界面共同影响留存。流量没有被视为无法跨越的壁垒。DeepSeek在没有大规模投放的情况下保留了大量用户,模型能力仍能改变产品格局。

  中国AI公司的结构性优势主要在成本和产品。中国公司长期擅长把工业品和服务做得更便宜,互联网行业也积累了产品经验。总算力存在数量级差距时,模型规模和整体能力仍会受到限制。

  B端市场也有当前上限。现阶段需求比算力更早成为约束。如果所有新增GPU都能在十个月左右回本,公司自然愿意继续采购;实际情况是,企业没有足够多的成熟任务消耗无限算力。Agent和持续学习取得进展后,可被模型完成的任务增加,B端需求才会继续扩大。

9、团队稳定是DeepSeek唯一不能退让的利益

  团队稳定被列为DeepSeek唯一不能退让的核心利益。核心成员只要继续合作,技术挫折主要影响进度。钱、卡和其他资源可以继续筹集,已经形成的研究文化与协作关系很难在短时间内重新建立。

  融资可以增加员工期权的实际价值,降低早期骨干流失风险。其他成员也会受到核心团队稳定性的影响。很多人加入DeepSeek,是希望参与AGI研究,收入只是决定去留的一部分。

  从过去几年的情况看,DeepSeek的人才流动低于同行。这与AGI目标、研究自由度和核心成员之间的协作有关。融资解决了部分期权价值问题,团队稳定仍然是公司最大的风险。

  公司人数增加后,原有组织方式也在调整。工程交付、运营和协同部门需要更明确的层级与流程;研究部门继续保持扁平,让研究员自主选择问题。

  重大决策主要通过共识推进。管理者的权威也建立在共识上,可以提出方向、参与讨论和引导,但团队没有形成共识的事项很难自上而下推进。V4发版一类目标明确、需要多人配合的任务,才会进入正式分工。

  DeepSeek内部有两条工作线。一条自上而下,用于发布新模型等需要全公司协作的正式任务;另一条自下而上,员工可以根据自己的判断发起研究,没有KPI,也不必为每个探索先申请项目。

  正式任务占用研究员的时间最好不要超过一半。剩余时间由员工自己安排,只要算力和其他条件允许,就可以开展实验。持续学习这类暂时没有确定路线的问题,需要依靠这种自由度推进。

  公司一般不要求长期加班。研究需要较松弛的环境;公司主动缩小了业务范围,员工也不必同时承担大量产品和商业任务。发版期仍然需要集中分工,数据标注等工作也必须完成。

  现阶段可能有一半核心研究员参与数据标注。后训练需要大量高质量数据,中国在高端数据标注上没有明显成本优势。瓶颈也包括培养标注团队和建立质量标准所需的时间。DeepSeek会先完成成本可控的数据工作,再逐步扩大投入。

10、API收入构成公司的商业底线

  DeepSeek无法复制贝尔实验室的生存条件。公司需要靠自己的收入活下去,没有长期公共资金支持,也需要考虑投资者和员工回报。

  如果模型技术长期没有新的突破,DeepSeek可以全力经营API。凭借现有C端用户、B端需求和成本效率,API业务可能支撑一家上市公司。若B端需求继续扩大,公司也可能进入净利润阶段。

  这给AGI研究提供了现金流基础。新一代模型取得进展,产品能力和收入上限继续提高;技术进入平台期,现有模型仍可对外提供服务。上市没有明确时间表,科研目标、商业收入和资本市场可以同时存在。

  中国基础模型公司最终会收敛。当前做基模的团队太多,算力、人才和资本分散在重复工作上。基础模型的利润率下降后,一部分公司会退出。中国市场可能留下三四家主要竞争者,两家大公司和两家创业公司已经足以形成充分竞争。

  DeepSeek不准备拿走AI产业的大部分利润。行业应用、数据服务、产品闭环和物理世界落地都可以形成独立公司。基础模型只占其中一部分,市场规模仍然足够大。

  如果一家公司希望拿走全球GDP的5%,愿意只拿1%的竞争者可以用更低价格挑战它;随后还会出现愿意拿0.1%的公司。份额过低无法支撑公司,份额过高会不断吸引替代者。DeepSeek希望停在能够覆盖研发、风险和长期投入的位置。

  开源、低价、减少C端投入、暂缓垂直应用、帮助合作伙伴部署,都来自这套收益计算。DeepSeek让合作伙伴进入更多业务,把人员、算力和管理注意力集中到基础模型与AGI研究。

  这条路也有风险。共同愿景能否适应更大的组织,投资者能否接受商业化节奏,持续学习何时取得突破,算力差距是否继续扩大,都没有确定答案。

  过去两三年的结果让DeepSeek继续沿用这套方法。C端用户在缺少大规模投放的情况下留了下来;B端收入开始增长;开源没有阻断官方API;低价促使团队持续提高计算效率;没有KPI的研究团队完成了V3、R1和V4。

11、双轨制组织哲学:自上而下与自下而上

  随着团队规模的扩大,DeepSeek 并没有生搬硬套互联网大厂的层级制度,而是形成了一种独特的“双轨制”组织形态。

  目前DeepSeek 内部同时存在两条并行不悖的工作线:

  自上而下的“正式任务”:用于应对如 V4 模型发版、集群部署等需要全公司高度协同的复杂工程。这类任务由管理层通过寻求“共识”来推动和分工。但梁文锋在内部设定了一条硬性红线——正式任务占用研究员的时间,绝对不能超过 50%。

  自下而上的“自由探索”:剩余 50% 以上的时间 必须完全留白,由研究员自主安排。没有 KPI,不需要事前写 PPT 申请立项,只要算力条件允许,研究员可以根据个人的兴趣与直觉自由开展实验。

  以“持续学习”为例,这类前沿课题并不需要堆叠成千上万张显卡,它不需要庞大的工程项目,需要的是极其罕见的技术灵感与直觉。梁文锋将这种研究比喻为“摸奖”:门槛很低,谁都可以去摸,但关键想法会在哪个研究员、哪次随机实验里突现,无法被自上而下地计划出来。

  因此,DeepSeek 坚持提供松弛的研究环境,不逼迫员工长期加班。他原话是:“逼得太紧是做不出创新的,研究需要松弛感;加上我们主动收缩了业务边界,事情少了,大家才能把心思放在思考最硬的难题上。”

12、高端数据标注无成本优势:50%核心研究员亲自下场

  在谈及大模型后训练(Post-training)与“幻觉”(Hallucination)消除时,梁文锋认为,中国在高端数据标注上,几乎没有任何成本优势。

  与基础的基础语言清洗不同,大模型后训练需要大量的复杂数学、代码逻辑以及专业领域的深层数据。这类数据无法通过低成本的外包劳动力完成,必须依赖高水平专业人才去审查与判断。中美公司在此类高端标注上付出的单力成本极其接近。

  OpenAI 和 Anthropic 依靠更充裕的资金与更早的布局,已经建立了成熟的数据标注流程与质量标准。而国内大模型行业大规模投入高端数据标注仅有约半年时间,追赶需要时间。

  为了突破数据瓶颈,DeepSeek 采取了两条腿走路的策略:

  1、研究员亲力亲为:梁文锋透露,目前 DeepSeek 大约有一半的核心研究员直接参与数据标注,亲自筛选和审视高质数据。

  2、渐进式扩大投入:在资本受限的背景下,先完成成本可控的高质量标注,建立自己的质量体系;随着融资到位,再逐步扩大数据团队规模。

  他预判,高质量数据标注的瓶颈主要在“时间”而非单纯的“资金”,随着国内团队流程与标准的建立,预计一年左右时间,国内在高质量数据生产能力上将看到明显的改观。同时,结合如 AlphaGo 自我博弈式的合成数据(Synthetic Data),模型完全有可能在人类既有知识库之外实现跨越式突破。

13、从“二十分之一算力”到“3-6个月代差”

  在中美算力存在数量级代差的客观事实下,DeepSeek 梳理出了一条全新的“追赶叙事”。

  梁文锋回顾过去 DeepSeek 证明自己的方式可以总结为:比美国落后 1 到 2 年(或 12-18 个月),但仅用对手 1/20 的算力,做出了相近水平的模型。

  而在融资到位、算力集群扩充以及国产芯片生态逐步建立后,DeepSeek下一阶段的目标是将这个叙事彻底重写。

  过去:落后 12-18 个月➡️消耗对手 1/20 算力➡️实现追平/相近效果。

  下一阶段:缩短至 3-6 个月➡️消耗对手几分之一算力➡️在特定核心方向率先超越。

  梁文锋指出,在总算力落后一个数量级的前提下,承诺“全面超越美国”是不客观也不现实的。DeepSeek 的策略是战略性取舍:

  接受在整体模型参数规模(如 800B 激活)上的暂时落后,将主战场放在自己用得起、训得好的几十 B 至 150B/250B 激活参数区间。

  将有限的资源集中砸在“持续学习”和“算法/工程计算效率”等关键山头上,力争在局部技术节点上率先取得全球领先。

14、拒绝成为贝尔实验室,也绝不复制字节

  在投资者交流会上,有投资人问及 DeepSeek 的组织终局是否会向历史上的“贝尔实验室”看齐。梁文锋给出了非常明确的否定回答。

  梁文锋强调,公司跟贝尔实验室不一样。贝尔实验室不需要考虑商业化,它背后有母公司的垄断利润补贴;但DeepSeek 归根结底是一家商业公司,政府不会给我们一分钱,我们必须依靠自己的商业收入活下去。

  但与此同时,DeepSeek 也绝不复制字节跳动或腾讯式的互联网商业闭环:

  1、不追逐买量与超级 App:不砸钱抢 C 端的流量红利,不强行做广告、电商、本地生活等复杂业务交织。

  2、不侵占合作伙伴空间:坚决不向垂直行业进行过度的垂直整合,把场景、数据和应用收益留给生态伙伴。

  DeepSeek 试图走通的是商业 AI 企业的“第三条路径”:

  AGI 纯粹科研➡️(产出阶段性成果)➡️API/基础设施服务 ➡️(10个月快速回本)➡️ 稳健现金流与利润 ➡️(持续反哺支撑)➡️ 长期AGI探索

  这种路径下,公司不仅有极为远大的 AGI 愿景,也有极其扎实的商业底线。梁文锋甚至给出了兜底推演:即便未来某一天大模型底层技术进入长期的“平台期”(停止爆发突破),光靠现有的 API 部署效率、C 端用户留存和 B 端需求,DeepSeek也完全足以成长为一家具备高额净利润的优秀上市公司。

15、具身智能的终局逻辑:用 AI 研发 AI,最后解救人类物理劳动

  关于技术的最终归宿,梁文锋将“具身智能”摆在了技术路线图的终点,并给出了极其朴素的现实逻辑。

  梁文锋说,人类的吃喝玩乐、衣食住行、医疗照护和物理劳动,最终都需要机器人去完成。如果 AI 的最终目标是解救人力,那么具身智能是绝对绕不过去的终局。

  但在实现路径上,DeepSeek 选择了与其他机器人公司截然相反的战略顺序:

  解决“持续学习”➡️实现“AI自我迭代奇点” ➡️由强大 AI 主导设计“具身智能系统”(优点:避开早期极其繁重、苦累的纯人工硬件与数据摸索,实现非线性研发加速)

  如果优先去做具身智能,需要投入海量的人力在物理世界里做机械打磨和数据采集,这是一条极度辛苦且效率低下的路。

  DeepSeek 的策略是“先难后易、先脑后体”:

  1、先攻克“持续学习”,让大模型具备长期适应和自主研究的能力。

  2、促成 AI 能够自主辅助甚至主导下一代 AI 模型的研发。

  3、到了这一阶段,再让具备高阶智慧的 AI 模型去直接参与设计下一代机器人与具身系统。

  梁文锋总结说,奇点之后再做具身智能,就不需要人类研究员这么辛苦地干了,模型自己就会把机器人设计出来。这是最轻松、也是研发收益最大的一条路。

16、梁文锋的“克制”

  至此,以上15个维度,把梁文锋在投资者日交流会中的核心观点完整还原。

  从对利润的克制、对流量的克制、对业务边界的克制,到对算力短板的理性务实;从独特的双轨制组织,到以AGI为绝对主线的降维打击,DeepSeek的发展,是一套在宏大愿景驱动下,将历史规律、计算效率与人性信任推演至极致的商业与科技思维。


扫描二维码手机访问

文章目录