标签: DeepSeek

  • 收费才是DeepSeek的“成人礼”

    声明:本文来自于微信公众号 字母榜,作者:彦飞

    DeepSeek首次融资的“金主”名单,逐渐浮出水面。

    6月3日,媒体报道称,DeepSeek计划募集约500亿元人民币,投后估值达3500亿至4000亿元。相比上月底传闻的700亿元,最新传出的融资规模略有收缩。

    除了DeepSeek创始人梁文锋承诺投入200亿元外,腾讯考虑投资100亿元,宁德时代也可能投资50亿元。综合多方消息,其他潜在投资方包括国家集成电路产业投资基金、网易、京东、砺思资本、IDG资本、基石资本等。

    DeepSeek是国内唯一尚未融资的主要AI公司。等到这笔资金到位后,它的财务压力将减轻不少。不过,和梁文锋的理想和大众对于 DeepSeek的期待相比,这笔钱显然远远不够。

    再大的公司,搞 AI 都缺钱。豆包已经确定要收费,DeepSeek或许可以学习一下。

    豆包5月初更新了App Store应用商店页面,公布了即将收费的消息,设置三档订阅价格,最低68元/月。

    6月3日晚间,豆包发布消息称,计划推出专业版,将包含软件开发等多项专业服务。用户日常使用的功能,包含搜索问答、写作生图,以及语音和视频对话等,将保持目前的免费服务。专业版的服务也将在一定额度内免费。

    豆包App启动收费,并不令人意外。

    AI App烧钱严重、收入却非常少,现金流转正遥遥无期,是所有AI公司都面临的难题。坐拥3.45亿MAU、1.45亿DAU的豆包,同样逃不开这一行业现实。

    更深层的难题是,互联网产品的边际效应不适用于AI产品。他们并不能像互联网产品那样,熬到用户量跨过某个节点后,立刻绝地逢生、扭亏为盈。恰恰相反,AI App的用户量越大,token使用量越高,亏损就越严重。

    deepseekv4

    赚钱,已经成为AI App的头等大事。直接收取会员费,则是最简单直接、立竿见影的手段之一。

    在国外,ChatGPT、Gemini、Claude、Grok等AI App早已搭建了一整套付费会员体系,同时对“白嫖”用户施加越来越多限制,形同“逼氪”。在国内,各大AI App吃相好看一些,但底层玩法并无二致。

    如今,国内活得最好的豆包,也把收会员费提上日程。

    但与同行相比,豆包背靠抖音这头现金牛,能够获得集团的资金支持。同时,字节多次上调火山引擎MaaS业务的全年营收目标,今年4月已达150亿元,相比去年底调高50亿元,侧面反映出字节AI的整体赚钱能力相当强劲。

    真正该快马加鞭、向C端用户收费的,或许是一直对商业化不太着急的DeepSeek。

    表面上看,DeepSeek在幻方量化的羽翼之下并不缺钱,数百亿元巨额融资也在路上。但豆包尚且需要靠卖会员“补贴家用”,DeepSeek资金实力更弱,也有必要广开财源。

    收费的另一重好处是,一直顺风顺水的DeepSeek,能够借机逼自己一把,在研发新模型之余,深入AI编程为核心的生产力场景,真正具备“干活”能力。相比技术、工程方面的创新突破,补齐这一短板的战略价值并不逊色。

    此前,DeepSeek违背“祖训”、引入外部股东,实现第一次自我突破。如今,一个敢于向C端收费的DeepSeek,将有机会再次完成“成人礼”。

    A

    DeepSeek的可用资金并不宽裕,表现之一是算力资源明显不足。

    主要AI App中,DeepSeek几乎是宕机次数最多的。特别是今年5月V4系列模型上线后,DeepSeek多次服务中断,相比前几个月更加频繁。

    宕机的部分原因是token消耗量飙升。根据AI模型聚合平台OpenRouter的数据,5月最后一周,DeepSeek V4Flash的token消耗量高达3.65万亿,环比增长32%,高居行业第一

    解决算力瓶颈并不困难:增加服务器、购买更多云端算力即可。不过,这也意味着更高的日常运营费用。DeepSeek若要不再频频宕机,就得多赚钱。

    在B端,DeepSeek已经具备加大收费力度的条件。

    最新发布的V4系列大模型虽然不算全方位SOTA,但性价比极为出色,吸引了大量专业用户和企业使用。再加上此前沉淀的口碑,DeepSeek完全有资格通过涨价赚得盆满钵丰。

    DeepSeek显然还不想马上“收割”。

    在竞争对手纷纷涨价的情况下,DeepSeek一个月里四次调低V4模型的价格,5月底更是永久降价75%,每百万token输入(缓存命中)0.025元,输入(缓存未命中)3元,输出6元,堪称今年AI圈的“价格屠夫”。

    DeepSeek释放的信号是:它希望聚拢尽可能多的B端用户,哪怕暂时赚不到钱,也要全力扩大用户规模。

    这与DeepSeek下一步计划——在生产力场景落地相契合。

    此前有报道称,DeepSeek组建了一个Agent Harness团队,方向是编程智能体,对标Anthropic旗下的Claude Code。与此同时,DeepSeek启动了相关职位的招聘。

    不难看出,DeepSeek对于B端市场期待很高,希望通过超低价跑马圈地,并不急于盈利。这也意味着,现阶段,C端收入需要扛起DeepSeek的商业化大旗。

    C端用户每天消耗token,却很少贡献收入,长期是AI App的亏损黑洞。

    以豆包为例,其日均token消耗量从2024年5月的1200亿,飙升至今年3月的120万亿,增长约1000倍,其中很大一部分源自C端用户。但由于AI App的chatbot功能均为免费、不限量,巨量的token消耗并不能直接转化为收入,只会带来亏损。

    在高峰期,这一矛盾更加突出。DeepSeek此前就有点儿“绷不住了”。5月29日下午,不少网友发现,DeepSeek重新生成、修改有次数限制了。有消息称,DeepSeek算力压力太大,采取了临时限制措施。

    但只靠临时限流,无法真正解决问题。更何况,DeepSeek正在添加多模态能力,图片、视频、音频的token消耗量百倍、千倍于文字,算力需求更大,带来的亏损也更严重。

    DeepSeek已经在找钱。但500亿的融资规模,比不上在港股市场狂飙的智谱、MiniMax,更比不上动辄融资千亿美元的OpenAI、Anthropic等巨鳄。只靠外部输血,DeepSeek迟早供不上仍在快速上升的C端用量。

    破局之道,恐怕只有直接向用户收钱,为高消耗的高阶功能设置付费墙

    这其实是把B端的API商业模式移植到了C端。唯有如此,DeepSeek才能让token用量与收入规模真正挂钩,算力瓶颈才有机会被真正化解。

    B

    向C端用户收费,除了能够立竿见影地获得收入,还能以商业化倒逼产品落地,帮助DeepSeek补齐生产力场景的短板。

    与国内AI公司相比,DeepSeek的长板是技术理念、模型能力、工程实现和性价比。每次发布新模型,它总是能够在这些维度上刷新行业认知,建立新的标杆。

    坐拥高性能、高性价比模型,DeepSeek对于AI生产力的挖掘却并不充分。在产品落地上,DeepSeek尚有不少短板。

    以AI编程为例,DeepSeek最新模型居于行业前列。按照DeepSeek的说法,V4的Agentic编程能力是开源模型里最强的,还针对Claude Code等进行了专项优化。V4发布后调用量迅速跃居行业前列,也从侧面印证了码农对于这一新模型的喜爱。

    问题是,DeepSeek缺少Codex、Claude Code这样的独立AI编程产品,开发者大都通过第三方工具调用DeepSeek V4等模型。这一定程度上限制了DeepSeek的商业前景,也让DeepSeek App的功能矩阵止步不前。

    当豆包、千问等想尽办法在App内塞入各种办公功能,并与电商、本地生活、学习教育等模块打通时,DeepSeek依然停留在chatbot的朴素形态,就连多模态都不支持。

    面向生产力场景,DeepSee手握好牌,却慢了好几步。而这种慢,又导致了App的商业化进展有限。两者互相拖累,形成恶性循环。

    如今,AI App纷纷开始收会员费,为DeepSeek提供了一个契机:以C端收费为切入点,让商业化先行一步,把产品侧的速度带起来。

    AI App卖会员,基础功能chatbot肯定还是免费,卖点只能是高阶功能。这类功能是否好用、够用,很大程度上决定了用户是否愿意花钱。

    以豆包为例,专业版将包含软件开发、数据分析、专业设计、流程自动化、金融分析、科学研究等专业服务。

    会员体系更成熟的AI App,则往往以AI编程为主打项。

    比如Kimi划分四档付费套餐,入门版本为连续包月每月49元,最高版本则为699元。不同档位的差距主要是Agent额度、是否支持Agent多任务并行、能否调用AI编程、是否支持专业数据库、能否“养虾”等。

    DeepSeek要想卖会员,就得效仿其他AI App,主动补齐生产力相关的能力矩阵。如今几乎白板一块的DeepSeek App,势必要经历一番大改造,才能端到用户面前。

    这一改造的技术难度不大,却高度契合高价值用户的需求,并与Agent时代注重工作能力的潮流相吻合。DeepSeek很早就应该做了,却在种种原因下,始终没有迈出第一步。

    后果已经显现:DeepSeek去年初击败一众玩家,登顶国内AI App榜首;如今却又被豆包反超,甚至落在了千问身后。这固然有其他App大举砸钱推广的因素,但DeepSeek功能单一,外加时常宕机,也是其热度下滑的重要原因。

    所幸,DeepSeek仍然拥有大量忠实拥趸。

    今年5月初,一个叫 DeepSeek-TUI的开源项目在GitHub引发关注,一天时间就收获1.6万颗星。它是一款基于DeepSeek V4的终端原生编程智能体,不少开发者称其“DeepSeek版Claude Code”。

    官方无法提供的生产力,粉丝就自己造。热情的粉丝,不仅为DeepSeek缓解了生产力的短板,也让它在开收会员费时有了更好的基础。

    C

    DeepSeek向用户收费,将是梁文锋的又一场“成人礼”。

    上一场“成人礼”,是它不再对外部资本说“不”。

    在风险投资驱动的AI行业,DeepSeek是一家颇为特立独行的公司:不接受外部融资、不稀释股权、不被任何人的商业化时间表绑架。“三不”原则造就了DeepSeek的独特气质和过往成功。

    但进入2026年,DeepSeek出人意料地抛弃了这些原则,转而与众多巨头和风投基金接洽。

    摆在梁文锋和DeepSeek面前的,是一个越来越清晰的事实:仅靠幻方量化每年7亿美元的收入,DeepSeek很难继续领跑,甚至会沦为二线选手。

    资金薄弱的影响正在显现。App用户量被反超;万众期待的DeepSeek V4,虽然依然是开源模型的SOTA,但与一众闭源旗舰模型相比并无优势;罗福莉、郭达雅等核心人员投奔巨头,更是DeepSeek难以弥补的损失。

    在资本市场上,DeepSeek最高4000亿元的投后估值,相当于两个MiniMax,却比智谱低了2500亿;相比万亿美元的OpenAI、Anthropic等,更是有两个数量级的差距。

    于是,DeepSeek改弦更张,腾讯、宁德时代等即将成为新的股东。外部投资者除了带来丰裕的资金,也可以给DeepSeek创造更宽阔的用户入口和落地场景,并将自家的生产力工具矩阵“嫁接”到DeepSeek上。

    但除了改变对于资本的看法,DeepSeek还需要商业化层面的“成人礼”——从“不赔不赚”,到“努力搞钱”。

    过去,梁文锋和DeepSeek对于盈利的态度非常谨慎。在他的构想中,DeepSeek将继续推进开源AI模型,并以实现通用人工智能(AGI)为目标。利润并非公司的首要目标。

    早在2024年宣布DeepSeek V2降价时,梁文锋就表示,DeepSeek 只是按照自己的节奏做事,核算成本后定价,原则是不贴钱,也不赚取暴利,希望在成本之上稍微有点利润。

    这套带有理想主义气息的逻辑,与OpenAI早年间的理念颇为相似。只不过,OpenAI几年前就抛弃了这一路线,转而朝着一家“正常”的公司转型,在赚钱的道路上狂奔;DeepSeek则尚未完成这一转变。

    另一方面,追求“不赔不赚”意味着,DeepSeek需要更加依靠技术、工程等方面的突破来保持领先,去年的R1、今年的V4系列模型就是这样。但在激烈竞争中,这并非最快的发展路径,也并不会总是能够成功。

    抱着旧思维的DeepSeek,面临新的竞争环境:AI已经从SOTA模型的对决,变成了既看产品和技术,更要赚钱逻辑的自洽、商业闭环的成立。

    国内外AI公司已经充分意识到这一点。他们在集体迈向资本市场时,都把商业化能力摆在重中之重,客户比用户更重要,而ARR(年度经常性收入)是关键指标。

    同时,资本市场正在奖励那些赚到钱的AI公司。Anthropic不仅收入规模超越OpenAI,还有望在今年第二季度首次扭亏为盈。在华尔街力挺下,Anthropic的估值已经反超OpenAI。

    DeepSeek无法改变这一趋势,只能改变自己、迅速适应。和其他AI公司一样,DeepSeek到了“努力搞钱”的时刻了。

    DeepSeek以往沿着梁文锋的想法前行,商业化怎么走、赚不赚钱,在于一念之间。但随着DeepSeek引入外部股东,这家公司的理想主义色彩注定消散,商业化进程势必加速。

    今年以来,DeepSeek已经在加大AI编程方面的努力。在这一大动作产生效益之前,效仿豆包及其他对手,向C端用户收费,将是一举多得的举措,也可以推动DeepSeek再一次完成战略思维的跃迁。

  • 梁文锋率领小龙过千亿

    声明:本文来自于微信公众号 字母榜,作者:李炤锋

    这个5月,中国AI产业的一级市场异常热闹。

    先是DeepSeek,这家国产超级AI独角兽正在推进成立以来第一次外部融资。最新信息显示,国家AI产业投资基金、腾讯等资方都进入了洽谈名单。

    一个月前,DeepSeek还被传以100亿美元以上估值融资;几周后,估值已经被推高到450亿—500亿美元区间。综合目前消息来看,DeepSeek本轮融资规模可能达到30亿—40亿美元,资金将主要用于算力基础设施、研发和员工激励。

    紧随其后,月之暗面被曝完成或接近完成约20亿美元融资,投后估值突破200亿美元。这轮融资由美团龙珠领投,中国移动、CPE等参投。

    几乎同一时间,另一家AI“六小龙”阶跃星辰,也传出近25亿美元融资将落地。值得关注的是,这轮融资里出现了华勤、龙旗、豪威、中兴等手机和消费电子产业链资本,被称为“港版淡马锡”的香港投资管理有限公司也被报道进入股东名单。

    三家头部AI独角兽同步推动融资,这并非偶然,而是中国AI产业经历了一场集体重估。以DeepSeek为代表,中国头部基模公司的估值门槛,已经来到了千亿人民币以上。

    要知道,几个月前,最先冲刺港股市场的智谱和MiniMax,上市前发型师估值都在500亿港元左右。

    而在1月登陆港股后,这两家公司迅速成为二级市场上少有的基模标的,市值成倍增长,截至本月9日,智谱最新市值已经突破4000亿港元,而MiniMax也稳定在2300亿港元。

    二级市场已经给了样板,那一级市场的热度,就只需要一个火花来引燃。下一轮基座模型公司的融资和IPO浪潮,终于随着DeepSeek的融资信号,来到了余下几家AI独角兽身上。

    AI客服 AI语音

    A

    谁也没有想到,中国AI独角兽的定价体系,就这样在过去几周之内被颠覆。

    三周前,有媒体爆料称,DeepSeek正在洽谈成立以来第一次外部融资,计划至少融资3亿美元,估值在100亿美元以上,但这一信号很快被资本市场捕捉并加速。

    几天前,一个重磅的名字出现在了DeepSeek的资方名单中,中国国家集成电路产业投资基金,也就是“国家大基金”,正在洽谈领投DeepSeek首轮融资,估值可能达到450亿美元。

    而根据最新消息,DeepSeek的估值可能已经来到500亿美元,融资额预计30亿—40亿美元,腾讯也在洽谈参与。

    换句话说,DeepSeek的估值在几周时间内,迅速在一级市场被做大了五倍。

    这轮估值抬升,一方面是因为DeepSeek被资本和产业侧同时看作国产AI底座的核心竞争者。尤其是在DeepSeek收入仍有限的情况下,仍被投资人看作国产AI战略中的关键公司。

    另一方面,市场一直都在期待DeepSeek打开融资的大门,但多年以来DeepSeek一直是拒绝外部资本的“技术理想主义者”形象。

    过去两年,DeepSeek主要依靠创始人梁文锋,以及母公司幻方体系内资金支持,外部投资人很难进入。但进入2026年后,AI产业的投入呈现指数级增长态势,研发、算力、人才竞争都在变贵。

    DeepSeek也面临来自字节、阿里等公司的竞争,不仅仅是在模型市场,也在人才竞争领域。比如,原DeepSeek的核心研究员郭达雅,就于近期转投字节跳动。

    另一方面,算力扩充也是推动融资的现实理由。母公司幻方早年曾为DeepSeek储备了约1万张规模的英伟达A100集群,但来到V4等新一代模型时期,训练和推理都在放大算力消耗;即便其正加速适配国产算力,继续扩充计算基础设施仍需要外部资金支撑。

    值得注意的是,阿里曾经也试图进入DeepSeek融资桌。

    几周前曾有报道披露,腾讯、阿里都曾与DeepSeek有过投资接触。但近期传出阿里和DeepSeek“谈崩”的消息。根据《每日经济新闻》的最新报道,有市场人士称,阿里“应该没有进行谈判”。

    另一方面,DeepSeek的这一轮资本故事,几乎和新一代模型V4同步落地。

    两周前,DeepSeek-V4Preview正式上线并开源。官方文档显示,V4系列分为V4-Pro和V4-Flash两个版本,最大上下文长度均为1M;V4-Pro总参数更是来到了惊人的1.6T。

    V4的外部反响,贯彻了DeepSeek一直以来的性价比路线。V4Pro的定价,为每百万输入仅为0.435美元、输出0.87美元;开发社区Hacker News上,有用户表示,用它跑同样代码审查,耗时约为Opus/GPT的两倍,但成本不到十分之一。

    与之对比,Anthropic最新给出的Claude Code企业开发者成本,已到日均13美元、月均150—250美元。

    所以,V4的市场反馈更像一次性价比回归:Artificial Analysis把V4Pro列为开源权重模型第一梯队、仅次于Kimi K2.6。

    更重要的是,V4的意义不只是模型升级,而是和国产算力强绑定。

    DeepSeek V4的一个关键变化,是适配华为最先进的昇腾AI芯片。华为也在第一时间宣布其昇腾超节点将全面支持DeepSeek V4;随后业内传出,字节、腾讯、阿里等头部AI厂商,在V4发布后正加速争抢华为昇腾950系列芯片。

    这把DeepSeek推到了国产AI算力生态的C位。

    过去,中国大模型公司很难绕开英伟达CUDA生态。模型越是要升级,越依赖高端GPU。DeepSeek V4在华为昇腾体系内得到验证,意味着国产基模和国产算力之间出现了一次重要的路线重合。

    这也是为什么,DeepSeek能成为这一轮融资潮的“领头羊”。

    而在DeepSeek的估值攀升的同时,其他头部基模公司,也有了新的估值参照系。

    B

    DeepSeek把估值锚抬高后,未上市的几家AI独角兽迅速迎来价值重估,首当其冲的就是月之暗面和阶跃星辰。

    公开信息显示,月之暗面近期这轮融资约20亿美元,投后估值突破200亿美元,由美团龙珠领投,中国移动、CPE等参投,其中美团龙珠出资超过2亿美元。

    这是月之暗面成立以来规模最大的单笔融资,也是彼时国内大模型创业公司金额最高的私募融资金额。

    至于为什么要说“彼时”,因为很快阶跃星辰和DeepSeek就打破了这一纪录。

    不过,抛开单轮额度,月之暗面的融资节奏也在今年密集落地。今年前两个月,月之暗面已经连续完成三轮融资,加上5月这轮20亿美元,不到半年融资超过39亿美元。

    换言之,月之暗面相比去年底的估值,已经翻了4倍有余。

    值得注意的是,月之暗面的每一轮融资背后,都有着美团系的重要身影。

    美团龙珠成立于2017年,是植根于美团体系的产业投资平台,早期更偏消费和本地生活投资,近年开始加码前沿科技。2023年7月,龙珠合伙人王新宇就参与了月之暗面的融资谈判,在Kimi爆红前进行了早期重仓。

    最近一轮持续加码后,王新宇也公开现身给月之暗面站台,他在近期采访中披露,Kimi在K2.5更新后,ARR于3月初突破1亿美元,4月升至超过2亿美元,付费订阅和API调用都在加速。

    美团联合创始人王慧文,则是月之暗面融资历程中的另一位关键人物。公开报道显示,他以个人身份多轮参投月之暗面,并在去年年底5亿美元C轮融资中继续跟投,累计投资额约7000万美元。

    模型方面,月之暗面的最新一代模型K2.6在几周前正式发布,K2.6强化了编程能力、长程任务执行和Agent集群能力,可支持最多300个子Agent协作,Kimi也开始同步测试Claw群组功能。

    测试数据显示,K2.6能够不间断编码13小时,编写或修改代码超过4000行,是Kimi迄今代码能力最强的模型。在智谱和MiniMax上市后,月之暗面一度被认为是“六小龙”剩余几位成员中,最有希望冲击IPO的公司。

    但与此同时,另一家“小龙”阶跃星辰也迅速行动起来。

    最近两天,多家媒体报道,阶跃星辰即将完成近25亿美元融资。融资名单里,除了一众地方国资外,华勤、龙旗、豪威、中兴等手机产业链资本集中入场,覆盖整机制造、核心器件、通信终端等环节。

    其中,华勤、龙旗是手机ODM龙头,豪威是图像传感器核心厂商,中兴是终端和通信设备厂商。它们投阶跃,多少有些产业合作伙伴下场站台的意思。

    另一方面,阶跃今年的资本动作也十分密集。今年1月,阶跃星辰完成超50亿元B+轮融资,投资方包括上海国资、国寿股权、浦东创投等;同日,千里科技董事长印奇,同步出任阶跃星辰董事长。

    印奇的加入,让阶跃的外部想象力迅速发生变化。姜大昕仍是阶跃创始人兼CEO,代表模型研发和公司经营;印奇则更像是资本、产业和终端场景的连接人。而印奇作为双料董事长的另一条线,也开始和阶跃发生更深绑定:千里科技以及其背后的吉利系资本。

    4月22日,千里科技宣布与阶跃星辰达成全面战略合作,双方将共建“原生智驾基座模型”。

    前荣耀CEO赵明在转投千里后也公开亮相,作为千里科技联席董事长的赵明在发布会上表示,千里科技和阶跃决定从基座模型预训练阶段开始深度融合,把通用语料与真实智驾感知、规控数据同源输入。

    这就能解释,为什么阶跃的融资名单里会有一批终端产业链资本。

    阶跃近期业务动作也围绕端侧Agent、语音模型和全模态能力展开。本月8日,阶跃发布StepAudio2.5Realtime,定位新一代实时语音大模型;更早之前,阶跃发布Step-GUI系列,试图把GUI Agent能力推向手机等终端场景。

    另一方面,尽管阶跃星辰和月之暗面的融资动作不断,但想要跑通港股IPO,仍有一个至关重要的环节:红筹架构拆分。

    红筹架构,通常是中国境内经营实体,通过境外控股公司承接境外融资和上市安排的一套股权结构。过去很多互联网公司通过红筹/VIE结构赴美、赴港上市。

    但近年来,涉及数据、AI、硬科技等行业的红筹架构公司,在境外上市备案和监管审核要求愈发严格。对准备赴港上市的公司来说,拆除红筹架构,往往意味着把股权和控制关系放到境内监管备案。

    目前公开报道显示,阶跃星辰已拆除红筹架构,这被视为赴港IPO的重要前置步骤;月之暗面方面,则是更多在磋商阶段,评估时间窗口与架构方案,但没有公开信息显示其在部署股改。

    这一轮的AI港股窗口谁先抢到,还有待进一步观察。

    另一家曾经的“六小龙”零一万物也被传出赴港IPO动向,最新报道称其正进行IPO前融资、筹划港股上市。

    零一万物方面回应称,当前聚焦企业智能体和市场落地,资本规划“开放且审慎”,暂无更多披露。估值上,零一万物2023年曾超10亿美元,但近期融资和新估值信息披露有限。业务上,公司已收缩超大基模预训练,转向企业智能体、垂直场景和行业交付。

    一个现实的情况是,“六小龙”的概念早已是过去式。头部的基模公司,如今都是各路投资机构的香饽饽,尤其是在DeepSeek这一轮引发了行业重估后。大模型的牌桌上,只有千亿身家以上的玩家。

    C

    在这个资本涌动的5月,大模型行业在一级市场的估值情况已经彻底改变。

    最新报道口径计算,DeepSeek450亿—500亿美元估值,约合人民币3200亿—3600亿元;月之暗面200亿美元估值,约合人民币1400亿元以上;阶跃星辰在运作25亿美元融资的同时,其目标估值已经来到了100亿美元。

    换句话说,一级市场正在默认一个新标准:

    中国头部基模公司,基本上以千亿人民币估值/市值为门槛。

    这个变化背后有多重因素的影响,首先是国产AI Infra层的推动。

    DeepSeek和华为昇腾在V4上的绑定,让国产基模和国产算力之间的路线开始重合,资本市场也迅速给出反应。

    5月首个交易日,国产算力板块全线爆发,云服务、半导体两大二级行业指数分别上涨5.77%、5.48%,位列全行业涨幅第2、第3位,两大板块合计26只个股涨停或涨幅超过10%。这一变化的核心驱动力,正是DeepSeek V4在国产算力领域释放的信号。

    多家券商的分析显示,国产算力芯片及解决方案厂商在2025年和2026年一季度普遍实现营收数倍增长,多家公司扭亏或利润大幅增长,行业正在从研发投入期转向商业回报期。

    换言之,这一轮重估的不仅仅是基模公司,而是整个模型—芯片—云平台的应用生态闭环。

    另一方面,是Agent浪潮下,大模型商业化开始在部分板块跑通。

    从年初“小龙虾”热潮,到全球Token调用暴增,再到Vibe Coding、AI编程和Agent工具全面铺开,一部分大模型公司已经找到了商业化突破口。

    智谱、MiniMax是第一批在港股市场吃到这一红利的公司,伴随着年初的“龙虾”热,OpenRouter模型调用榜单上,两家公司的主力模型一度把Gemini、Claude等海外模型挤在身后,也造就了两家公司的股价不断攀升。

    换言之,在Vibe Coding、Agent工具这些场景里,商业化回报已经开始显现。而这也正是DeepSeek、月之暗面擅长的领域。

    最关键的一点是,当前的大模型市场上,有实力的通用基模玩家越来越少,产业资本开始提前锁定入口。

    通用基座模型,不是所有公司都能继续烧下去,这个命题一直是行业内的共识。

    零一万物创始人李开复曾直言,“只有大厂能够烧超大模型”,他认为中国市场最终可能只剩下DeepSeek、阿里和字节三家大模型公司。无论这个判断是否最终成立,它都反映了一个现实:基座模型只会留给少数有实力的企业。

    在这种背景下,未上市的优质基模公司会变得更稀缺。

    而阶跃星辰的融资名单,一众终端厂商的名字,也反映出大模型公司和外部产业链正在更深绑定。手机、PC、汽车、可穿戴设备都在寻找AI时代的新交互方式,语音、GUI Agent、多模态理解和端侧推理,都在探索下一代终端的形态。

    产业资本投AI,本质上是在给自身行业未来的“原生AI大脑”投资。

    但这轮融资潮也有明显的不确定性。

    二级市场已经先给了一次提醒。智谱和MiniMax上市后大涨,确实把港股AI资产的估值天花板拉高。

    但高估值也意味着高波动。DeepSeek V4发布后,智谱和MiniMax股价曾显著回调,市场担心新模型会推动价格竞争。

    另一方面,智谱和MiniMax预计6月纳入恒生科技指数和港股通,但真正压力测试是7月解禁潮,MiniMax近50%股份解禁,流动性溢价面临考验。

    这恰恰说明,大模型公司的估值不是只涨不跌。资本市场可以提前定价未来,也会很快修正预期,这放在DeepSeek、月之暗面、阶跃星辰身上同样成立。

    此外,代表B端基本盘的AI云市场和C端流量仍牢牢掌握在字节、阿里、百度、腾讯等大厂手里。

    QuestMobile一季度报告显示,豆包、千问、DeepSeek月活分别达到3.4亿、1.7亿、1.3亿,行业用户规模和粘性同时提升。这里面,只有DeepSeek是一个例外,它没有大厂的投流加持,却仍能维持在C端国产AI应用头部阵营。

    但这也说明,DeepSeek的特殊性很难被复制。多数AI独角兽,还是要在大厂夹击中找到自己的位置,在持续打磨基模的同时,不断探索商业化出路。

    眼下的“疯狂5月”,对几家基座模型公司而言,还远远不是兑现答案的时刻。

  • DeepSeek首次有了视觉能力,技术论文却被它连夜删掉了

    声明:本文来自于微信公众号 硅星人Pro,作者:孙芮

    DeepSeek做了件罕见的事情:在终于开始灰测多模态能力后,它放出了一篇解释背后技术的论文,但这篇论文却在发布没多久就又被悄悄撤掉。

    4月29日,DeepSeek研究员陈小康在X发布一条推文——现在,我们可以看见你了。配图中,DeepSeek 标志性的鲸鱼 logo 摘下眼罩,露出了眼睛。

    过去,DeepSeek 最被外界熟知的是它在文本、代码和推理任务上的能力。但真实世界里的问题,并不总是以文字形式出现。它们可能是一张照片、一页论文图表、一个网页截图、一份复杂表格,也可能是一个需要理解空间关系和视觉细节的现实场景。

    对 DeepSeek 来说,视觉能力是让它的推理能力从文本世界延伸到真实世界的关键一步。但这次灰测的视觉能力,很快被使用者们感觉到不同:它和其他模型给语言模型底座增加多模态功能不同,更像是一个单独的模型,且不是以附庸形式定位,而是有某种原生的思考和推理能力。

    就在大家好奇心增加的时候,DeepSeek发布了一篇解释它追求的视觉能力的论文:《Thinking with Visual Primitives》。

    Primitives是图形学和几何里的常用术语,Visual Primitves可以理解为那些用来描述几何信息图形空间信息的最基本元素,也可以称为视觉基元。从这个题目就可以看出,DeepSeek眼里此刻最重要的“多模态”能力,依然是围绕推理和思考,它要让模型能在原生层面用图形的基础语言做更准确的思考。

    这并不是所有主流模型厂商在多模态领域的方向,这让人意外,但这个想法非常有趣。DeepSeek再次给基础研究提供了新的思路。

    但更加让人意外的是,这篇论文很快就被撤下了,没有给出任何解释,也不确定是否会再次发布。

    所以,DeepSeek这次的视觉能力到底是怎样的?我们结合实测、它的研究员的分享,以及这篇“消失”的论文的内容,来尝试解释一下它的做法。

    01当DeepSeek 的视觉能力,开始进入真实场景

    目前DeepSeek的视觉模式还在灰度测试,逐步向用户开放中。

    从 X 上已经试用到这一功能的用户反馈来看,DeepSeek 的视觉能力并不只是识别图片里有什么,更重要的是,它会尝试把图像中的信息和已有的世界知识联系起来。

    有用户在X上表示DeepSeek视觉模式的世界知识非常丰富,思考过程也很有趣。他在公司附近拍了一张照片,发给DeepSeek。在DeepSeek的思考过程中可以看到,它几乎知道我公司附近的每一栋楼,并尽量搜索正确的那栋。并且这个过程中没有用到联网搜索能力。

    还有用户表示DeepSeek的网页复刻还原能力非常好。这对设计师和产品经理来说,它可以让视觉稿更快变成可演示的原型。以前从 Figma、截图或参考网页到可点击 demo,中间需要设计师标注、开发切图、工程师实现。现在模型能直接读懂页面,并生成接近真实效果的网页,让想法验证的周期大幅变短。

    我实际测试了DeepSeek的视觉理解能力。我发送了一张迷宫图让它解答。

    DeepSeek的思考过程十分严谨,它用的是反向推理的方法,从终点出发,逐步反向追踪,走到起点。为了验证解法的可行性,DeepSeek这一路径用正向的方式走了一遍,然后它又核算了一遍,再输出最终答案。整个过程中,DeepSeek推理了四遍路径的可行性。

    02多模态模型的难题,不只是看不清

    陈小康在30号发布的推文中给了更详细的解释:传统的思维链(CoT)主要停留在语言空间里,但视觉推理需要更多能力。通过把点和框作为认知锚点,我们的模型弥合了“指代鸿沟”(Reference Gap),模拟了人类在视觉推理中常用的“指向—推理”协同机制。

    通过DeepSeek发布的报告,我们可以看到他们针对视觉理解提出了一个新的推理框架,就是使用视觉基元进行思考(Thinking with Visual Primitives)。

    什么是使用视觉基元进行思考呢?

    简单来说,就是让模型在看图推理时,不再只依赖自然语言描述,而是把图像中的点、边界框、路径坐标等空间标记,也作为推理过程的一部分。

    以往多模态模型面对一张图片时,通常会用语言来组织思考。比如它会说“左边那个人”“右上角的物体”“中间那条路”。但问题在于,这些描述在人类看来很自然,对模型来说却并不总是精确。尤其在一张复杂图片里,如果有很多相似的人、物体或区域,“左边那个”“旁边那个”很容易变得模糊,模型也可能在推理过程中把对象搞混。

    DeepSeek 在报告中把这个问题称为“指代鸿沟”。也就是说,模型不是完全看不见,而是看见之后,很难在连续的视觉空间中稳定地指向自己正在讨论的对象。

    视觉基元要解决的正是这个问题。所谓视觉基元,可以理解为模型在图像中的“手指”。当模型数一张合照里有多少人时,它可以先用边界框把每个人标出来,再进行统计;当模型判断两个物体的位置关系时,它可以先框出相关物体,再比较它们的相对位置;当模型走迷宫或追踪一条线时,它可以用一串点记录路径,而不是只用语言说“往左、再往右”。

    这样一来,模型的推理就不再悬浮在文字里,而是被锚定到图像中的具体位置。这也是 DeepSeek 使用视觉基元进行思考最重要的变化,多模态模型的能力不只是看得更清楚,还要指得更准确。

    03DeepSeek 怎么做视觉推理

    陈小康指出,目前DeepSeek的视觉模型主要处理三类任务:计数、空间推理和拓扑推理。

    DeepSeek 的做法不是简单让模型看更高分辨率的图片,而是让模型在推理过程中使用点、框、路径坐标这些“视觉基元”,把每一步判断都落到图像中的具体位置上。

    在计数任务上,DeepSeek 主要使用的是边界框。

    报告中说,多模态大语言模型一直很难做到准确计数,尤其是在密集场景中。人类在数东西时,通常会采用一种“系统扫描和累加”的方式,比如从左到右一个个点着数。但语言模型在对象数量较多时,很难建立精确的对象对应关系。为了解决这个问题,DeepSeek 使用边界框作为视觉基元,为每个被计数对象提供明确的视觉锚点。

    也就是说,模型不是直接凭感觉回答“有多少个”,而是先把目标对象找出来、框出来,再基于这些框进行统计。比如数一张合照里有多少人,模型会先框出图中的每个人,再计算总数。对于更复杂的细粒度计数,比如“有几只熊在地面上”,模型还会先找出所有熊,再逐一判断它们是在树上还是在地面,最后得出答案。

    报告中还把计数分成了两类:一类是粗粒度计数,比如数“狗”“人”“车”这类普通对象;另一类是细粒度计数,比如数“白色的狗”“左边的狗”“站在地上的熊”。后者不仅要求模型识别对象,还要判断颜色、位置、状态等附加条件。DeepSeek 在这里采用的是“定位—验证—统计”的流程,让模型先找到候选对象,再逐个判断是否符合问题条件。

    在空间推理任务上,DeepSeek 也是先让模型用视觉基元锚定对象,再进行关系判断。

    报告中说,空间推理和一般视觉问答被放在同一个类别里处理,因为这类任务的共同难点是:如果只用语言描述,模型很容易出现指代模糊和语义漂移。比如“灰色金属物体”“旁边那个小物体”“同样大小的紫色橡胶物体”,这些说法如果不落到具体图像区域上,模型在推理过程中很容易把对象搞混。

    所以 DeepSeek 的方法是,让模型先把关键对象框出来,再根据这些具体对象进行多步推理。报告中的例子是,模型需要判断图中是否存在一个紫色橡胶物体,和灰色金属物体大小相同。模型会先定位灰色金属球,判断它是小物体;然后再逐一检查其他小物体,看它们的颜色、材质、大小是否匹配。最后模型得出结论:图中没有符合条件的紫色橡胶物体。

    在拓扑推理任务上,DeepSeek 主要使用的是点。

    拓扑推理关心的不是某个物体是什么,而是路径、连通性和结构关系。比如迷宫里从起点能不能走到终点,一堆交错的线条中,某一条线最终连到哪个图标。这类任务对多模态模型尤其困难,因为它要求模型持续跟踪路径,而不是看一眼就回答。

    报告中说,纯语言的思维链很难准确描述不规则形状的轨迹,因此使用点作为认知单元的视觉基元,特别适合处理这类问题。

    在迷宫导航任务中,DeepSeek 会让模型先找到起点和终点,然后像做深度优先搜索一样探索路径。模型每走到一个关键位置,就用点坐标记录下来;如果遇到死路,就回退到前一个岔路口,再尝试另一条路径。报告中提到,模型需要理解空间连通性和可达性,也就是判断哪里有路、哪里被墙挡住、哪条路径最终能到达终点。

    在线条追踪任务中,模型也会用一串点来表示自己沿着哪条线走。报告中说,这类任务的核心挑战是交叉点消歧:当两条线交叉时,模型必须根据局部几何连续性判断哪一条才是目标线的延续,而不是被另一条线带走。为了防止模型只是靠颜色猜,DeepSeek 还设计了所有线条颜色和粗细都一样的样本,迫使模型真正根据曲线连续性来追踪路径。

    04视觉基元并不是终点

    不过,使用视觉基元进行思考,并不意味着视觉推理问题已经被彻底解决。它最大的优势,是让模型的视觉推理变得更稳定,也更容易被验证。

    这会带来两个直接好处。

    一是减少幻觉。模型如果要判断“这里有没有紫色橡胶物体”,就不能只凭语义猜测,而要先在图中找出候选物体,再逐一排除。二是提高可解释性。比如模型说一张图里有25个人,如果它同时框出了这25个人,用户就能判断它有没有漏数、重复数,或者把其他物体误认成人。

    这也是为什么 DeepSeek 的视觉模式在网页复刻、迷宫求解、复杂图像问答这类场景中会显得更有用。网页复刻需要模型理解页面里的模块、层级和布局关系;迷宫求解需要模型持续追踪路径;复杂图像问答则要求模型在多个视觉线索之间来回比对。它们共同需要的不是一句笼统的图片描述,而是模型能够稳定地“看图说话”。

    另一个优势是效率。报告中提到,DeepSeek 并不是简单依赖大量视觉 token 来弥补视觉能力,而是通过更高效的视觉 token 压缩架构,让模型在较低图像 token 消耗下仍然保持较强的推理能力。报告中说,对于800×800的输入图像,其模型在 KV cache 中只保留大约90个条目,却能在计数和空间推理等基准上取得有竞争力的表现。

    DeepSeek 想走的路线,并不是无限提高分辨率、堆更多图像 token,而是让模型更有效地使用视觉信息。

    但这套方法也有局限,报告中提到这类方式有三部分的局限。

    首先是受输入分辨率限制,模型在细粒度场景下的表现仍然不够理想,有时会输出不够精确的视觉基元。也就是说,如果图像里的目标非常小、细节非常密,或者需要识别的区域边界很模糊,点和框本身也可能标得不准。视觉基元能改善指代问题,但它不能完全替代感知能力。模型首先要看清楚,才谈得上指得准。

    第二个局限,这种能力目前还依赖显式触发。报告中说,当前使用视觉基元进行思考的能力需要通过明确触发词来激活,未来希望模型能够根据具体上下文,自主判断是否调用这一机制。

    这意味着,现在模型未必会在每个需要的场景里自动使用这项能力。用户如果只是普通地问“这张图里有多少人”“这条路能不能走通”,模型可能仍然用普通语言推理,而不是主动输出点、框或路径。真正理想的状态应该是,模型自己判断这个问题是否需要精确视觉定位。如果是计数、路径、空间关系这类任务,它就自动拿出“手指”;如果只是描述画面氛围,就不必调用这套机制。

    第三个局限,是拓扑推理仍然很难。报告中说,使用点作为视觉基元来解决复杂拓扑推理问题,仍然是一项艰巨挑战,目前模型的跨场景泛化能力也有限。

    这不难理解。点可以告诉模型“我现在走到哪里”,但点本身并不直接表示“这里和那里是否连通”。在迷宫里,两个点看起来很近,中间可能隔着一堵墙;在交错线条中,两条线可能在视觉上相交,但实际并不是同一条路径的延续。模型不仅要标点,还要持续判断连通关系、路径方向和局部几何连续性。只要中间某一步走错,后面的推理就可能全部偏掉。

    所以,视觉基元让模型开始能够在图像中定位、比较和追踪。但要真正处理开放世界里的复杂视觉问题,还需要更强的感知能力、更稳定的自主调用机制,以及更好的跨场景泛化能力。

    在视觉理解层面,DeepSeek 给出的答案是,让图像不再只是输入材料,而是成为模型推理过程的一部分。模型不只是看见世界,而是开始学会在世界中找到锚点。

    这不像是一个附带的研究,更像是DeepSeek对视觉的最重要的一个不同的理解。因此这次罕见的删除论文行为也引起不少遐想,有人认为它对于开源模型来说“太强大”了,以至于不适合发表。真相如何可能要等DeepSeek自己给出解释了。

  • 这一次,梁文锋和杨植麟隔空握手

    声明:本文来自于微信公众号 字母榜,作者:苗正

    真是热闹的一周。

    周一,Kimi刚发完Kimi K2.6;周五,万众瞩目的DeepSeek V4就来了。

    这种感觉很熟悉。

    过去一年,这两家公司不是前后脚发模型,就是前后脚发技术论文,不是你把市场热度点着了,就是我把技术讨论接过去了。

    更早之前,说起中国开源模型,几乎条件反射地想到DeepSeek。

    尤其是DeepSeek发布R1之后,这家公司不仅凭一己之力改写了全球市场对中国AI的印象,而且唤醒了其他中国的AI创业团队的“信心”。

    于是,我们看到,更多的中国AI创业团队开始做出非常竞争力的模型,带来非常有影响力的技术研究成果。

    2025年7月,被《自然》杂志称为“又一个DeepSeek时刻”的Kimi K2模型,在底层架构上首次大规模验证了二阶优化器 Muon,同时采用了 DeepSeek验证过的 MLA注意力机制。

    到了2026年4月,DeepSeek V4在架构上也跟进 Kimi K2采用 Muon优化器,取代过去已经使用了10年的Adam优化器。

    这可能是开源最大的价值:让中国公司共享技术,加速追赶美国的闭源巨头。

    它们是中国目前唯二,总参数超过万亿、已权重公开的中国模型。也是最有国际影响力的中国AI模型代表。全球市值最高的英伟达公司在展示下一代芯片性能时,用的模型正是来自 DeepSeek 和Kimi。

    不仅如此,他们也都在挑战深度学习网络的底层架构,DeepSeek有mHC残差连接,Kimi有引发硅谷核心技术圈讨论的“注意力残差”。

    A

    虽然说DeepSeek V4和Kimi K2.6在同一周发布,但其实两个模型各有技术侧重点。

    V4的核心突破在于百万上下文的成本重构,它通过全新的混合注意力机制,将单token推理的计算量压缩到V3.2的27%,KV Cache降至10%。

    这套方案结合了压缩稀疏注意力和重度压缩注意力,让百万级上下文从技术演示变成了可以普及的基础设施。

    V4同时针对agent场景做了专项优化,后训练阶段把agent作为独立方向单独训练,工具调用格式从JSON换成带特殊token的XML结构,跨轮次推理痕迹在工具调用场景下完整保留。

    DeepSeek还自建了名为DSec的沙箱平台,单集群可并发管理数十万个沙箱实例,用来支撑agent强化学习训练和评测。

    K2.6的方向则更偏向长程编码和agent集群。它在Kimi Code Bench内部评测中得分68.2,比K2.5的57.4提升约20%。

    最高可支持300个子agent并行完成4000个协作步骤。

    图片

    B

    2025年2月,Kimi 发布 Moonlight系列模型,首次将二阶优化器Muon应用于480亿参数的大模型,验证了新一代优化器的效果。

    2025年4月,Kimi-VL模型发布,在Moonlight模型的技术上,引入MoonViT视觉编码器,为之后的多模态理解模型打下基础。

    2025年7月,Kimi首次将Muon优化器扩展到万亿参数的规模,推出 K2开源模型。

    2025年10月,Kimi发布Kimi Linear,这是Kimi提出的一种线性注意力架构,核心目标是在保住长上下文能力的同时,把大模型处理超长文本的计算和显存成本降下来。

    这说明杨植麟已经不满足于只做模型了,他想对模型的底层架构动手。

    随后,Kimi发布并开源支持图片和视频理解的万亿参数模型Kimi K2.5。

    2026年3月,Kimi发布注意力残差的论文,继续对Transformer的底层结构下手。

    这篇论文在X上收获了马斯克本人的称赞。

    在然后就到了前几天的K2.6,这是一个围绕长周期编码、agent执行、工程任务能力的模型。

    从产品定位的演变可以看出,Kimi正在从消费级对话产品往生产力工具转型。

    2026年3月,杨植麟在英伟达GTC大会上发表演讲,系统介绍Kimi技术路线,他用三个关键词概括Kimi的Scaling策略:Token效率、长上下文、agent集群。

    他表示,要推动大模型智能上限的持续突破,必须对优化器、注意力机制及残差连接等底层基石进行重构。

    当前的Scaling已经不再是单纯的资源堆砌,而是要在计算效率、长程记忆和自动化协作上同时寻找规模效应。

    一家公司最怕的是,只有媒体在讨论你,开发者却不用你。

    但Kimi不一样,无论是在OpenRouter上还是绝大多数agent工具的默认接口里, K2.5和K2.6都是主流选项。

    截止发稿,Kimi和DeepSeek都出现在OpenRouter的TOP3模型里,在AA的榜单上,K2.6甚至暂时占得先机。

    图片

    而在K2.6这里,模型继续强化agent、长任务、编码能力,也是同一个信号。杨植麟真正押注的,就是生产力场景。

    这也是Kimi这一年最关键的变化。

    它不再只是告诉用户“我能帮你读更长的文件”,而是在回答更底层的问题,模型怎样才能在更长时间、更复杂任务、更高工具调用密度下保持稳定?

    长上下文解决的是记忆和信息承载;线性注意力解决的是成本和扩展性;agent集群解决的是复杂任务拆解;编程能力解决的是模型的理解和执行。

    它们看起来是几条不同产品线,其实背后指向同一个方向,Kimi想把Kimi从一个好用的聊天窗口,变成可以承接真实工作的基础模型。

    4月,杨植麟受邀参加经济形势专家和企业家座谈会,作为唯一的大模型创业者代表发言。这个1993年出生的年轻人,成为座谈会上最年轻的参会者。

    一个月前,他刚在2026中关村论坛年会全体会议上发表演讲,系统阐述了中国AI团队如何通过底层架构的“推倒重建”,打破沿用十年的行业技术标准。

    显然,Kimi已经从一家创业公司,变成了代表中国AI技术路线的符号之一。

    Kimi这一年的成长路径,和DeepSeek的路径有明显差异。两家公司的技术选择不同,但也正因如此,才让中国开源模型有了更多可能性。

    C

    过去我们写这两家公司,容易写成“谁的模型好”、“谁才是下一个OpenAI”。

    但这其实是个误区。

    DeepSeek和Kimi,不该被简单理解成“谁赢谁输”。它们更像中国开源模型对外竞争的两条腿。不存在谁取代谁,而是应该互相刺激互相促进。

    DeepSeek和Kimi相继证明了一件事,做前沿模型不一定需要无限的资源,关键在于算法创新和工程优化。它们在模型算法、工程效率、开源路线和降低推理成本上的贡献,仍然是中国AI过去一年最重要的技术事件之一。

    它们彼此竞争,但也彼此抬高了中国开源模型的上限。

    真正重要的不是它们谁先到终点,而是它们把中国模型的竞争维度拆开了。

    过去我们评价一家模型公司,很容易只看榜单、参数、价格、发布会声量。

    但模型公司真正的护城河,已经不再是“模型聪不聪明”、“模型性能如何”这些事了。现在围绕模型的叙事,是它能不能形成一整套技术路线。

    DeepSeek把第一件事做得很彻底。它让外界看到,中国公司可以用更高的工程效率,把模型训练和推理成本打下来,可以把技术报告写到足够透明,可以把权重开放到足够激进。

    它建立的是一种开源信任。开发者愿意研究它、复现它、部署它,是因为它不只是给了一个API,而是把模型背后的方法论也拿了出来。

    Kimi补上的是另一块。

    Kimi最早被用户记住,是因为长文本和聊天产品,但K2.6之后,它讲的已经不是一个更会聊天的助手,而是模型如何进入真实工作流。

    长程编码、Agent集群、工具调用、长周期任务,这些能力没有“霸榜”那么直观,但它们决定模型能不能从“被试用”走向“被依赖”。

    如果说DeepSeek解决的是模型够不够强、够不够便宜、够不够开放的问题,Kimi更关心的是模型能不能真的替人完成复杂任务。

    所以这两家公司放在一起看,意义反而更大。

    作为观察者和用户,我们肯定希望都存在,这样产业才能发展。

    中国AI真正值得兴奋的,不是终于出了一个DeepSeek。

    而是在DeepSeek的带动下,Kimi们依然能靠自己成长为一座座大山。

    这说明中国AI公司已经开始在不同维度上找到自己的位置,不再是简单模仿,是真正的在探索自己独有的那条技术路线。

    DeepSeek和Kimi的技术互相赋能,也说明了一件事,开源生态的价值在于协作。

    现在的问题不是DeepSeek和Kimi谁更强,而是它们能不能继续保持这种竞争关系,继续在技术上互相刺激。

    中国开源模型要真正在全球站稳脚跟,需要的不是一家独大,而是多家公司在不同方向上都做到世界级水平。DeepSeek和Kimi的存在,让这个可能性变得更大。