标签: 面壁智能

  • 面壁智能BitCPM-CANN:端侧AI的内存革命

    声明:本文来自于微信公众号 光子星球,作者:郝鑫

    大模型决定了“脑容量”,定义了模型的知识上限与智能天花板

    低比特技术,则是让大模型“小而强”的魔法,它重新排列了每一个“脑细胞”的密度。这条路指向两个明确的方向:要么在有限的内存与显存资源下,塞进参数规模更大的模型;要么让同样大小的模型,跑得更快、更省电。

    低比特模型一直处于小众赛道,直到今年内存价格一年涨了5倍,倒逼整个大模型行业寻求性价比更高的落地解决方案。

    而早在2024年下半年,面壁智能就开始押注2-bit及以下的技术路线。彼时,面壁智能AI Infra团队在训练时观察到,从BF16到INT4(从高精度到底精度),模型能力损失极小,说明“甜蜜点”一定在更低处。

    基于此,他们在当时形成了两个“反共识”:更低比特的模型,能获得更高的知识密度;内存是模型行业最稀缺的资源,未来一定会变得越来越值钱。

    带着这样的判断,面壁智能在GPU上率先验证了BitCPM系列。到今年,他们将这套方法论完整迁移到了华为昇腾,端到端跑通了国产算力平台的1.58-bit训练。

    图片

    测试数据显示,相比传统BF16精度,BitCPM-CANN在推理阶段释放约6倍显存空间,同时将模型能力保留率维持在90%–97.2%。这意味着,同等模型能力在终端运行,只需过去1/6的内存。

    1.58-bit的极限挑战

    “1.58-bit是技术极限验证的探针”。

    面壁智能AI Infra技术负责人、清华大学计算机系高性能所的水木学者博士后李宇轩向光子星球解释,开源发布最极端的1.58-bit,目的是为了验证极低位宽量化感知训练之路能否走通。

    “1.58-bit是保证训练稳定、模型能力不崩塌的最低位宽要求。如果这都能成功训练并保持高能力,那么2-bit、4-bit、8-bit等更宽松的低比特方案自然更容易实现,且效果更好”,这是一种取法乎上,仅得乎中的技术策略,即先攻克最难的点,然后再向下兼容。

    如何获得参数更小却更强的模型?行业中传统的解法是PTQ(后训练量化),即先用高精度如BF16完成模型训练,再将其权重压缩至INT8或INT4。

    INT4是一种4位整数精度,相比BF16节省4倍内存,是目前低比特量化的“实用基准线”,而1.58-bit则是突破这条线,向极限压缩进一步逼近的探索。

    这本质是一种以精度换内存的做法,压缩越狠,性能损失越大。就好比把一本写好的名著,压缩成口袋书,每个字只能用原来4/1的墨水写,结果是字迹模糊、内容丢失,有的地方甚至看不懂。

    正是看到了PTQ的弊端,面壁智能在训练上采用了先做QAT(量化感知训练)、再蒸馏的方案。李宇轩表示,这个方案的核心是既能稳定收敛,又能保留全精度能力。这相当于作者最初就知道要被制作成口袋书,直接用更简洁的语言表达相同的内容,所以压缩后依然清晰可读。

    以前我们认为,位宽越大、精度越高,模型就越聪明。但面壁智能的实践证明,重要的不是每个参数占多大地方,而是占的每一寸地方装了多少知识。低比特训练不再是,为了省内存而牺牲精度的妥协,而是一种全新的思路:用最少的资源,承载最高的知识密度。

    根据BitCPM-CANN与同尺寸MiniCPM-4全精度模型家族在常识、阅读理解、学科知识、数学与推理等11项任务上的1:1性能对照。

    图片

    BitCPM-CANN三个尺寸模型的能力保留率达到95.7%-97.2%,即使是能力保留最弱的0.5B,保留率也达到了90%以上,几乎保留下来原本大模型的能力。

    我们来简单算笔账,同样一个8B大小的模型,用传统BF16格式存,光权重就要吃掉16GB空间,普通手机根本装不下。但用1.58-bit格式存,释放6倍显存占有空间,所占大小手机差不多相当于一部完整的高清电影。

    李宇轩告诉我们,未来他们将进行更精细化的数据处理,将0.5B档的模型能力保留率提升至95%。同时结合MoE架构,利用稀疏专家扩展容量上限,60B参数的超大模型有望装入手机。

    跑出一条国产低比特之路

    内存价格暴涨,正在倒逼行业算清楚经济账。

    公开信息显示,2026年DDR5内存价格暴涨数倍,32G条从年初的500元涨至超4000元,HBM更是天价。

    这让本身就对价格敏感的端侧厂商陷入了两难境地。有手机厂商告诉我们,用户期待更强的AI能力,但内存涨价3-5倍后,若维持原内存升级节奏,价格翻倍;不涨配置则体验倒退,用户不买单;涨价又怕丢失市场,部分旗舰机型已经被迫原地踏步。

    要解决上面的难题,国产替代是一个解决思路。国产厂商长鑫存储已率先破局,DDR5实现量产,其价格比国际同类产品低15%-20%。换用国产内存,同样容量立省两成,从源头上缓解了成本压力。

    低比特技术则指向另一条路径,不在“买内存”上省钱,而是在“用内存”上极致压缩。厂商无需堆砌更多内存,就能让手机跑起参数量翻倍的模型。结果是,用户既能感知AI体验升级,厂商又能实现降本。这正是今年行业突然重视低比特模型的根本原因,跳出学术探索范围,低比特模型未来可能成为化解端侧AI商业焦虑的那把钥匙。

    在此基础上,面壁智能填补了国产低比特大模型市场的空白。其BitCPM-CANN是首个在昇腾上端到端,原生完成训练的1.58-bit极低比特大模型,从算子、算法到训练框架全是国产。这证明了国产算力平台不仅能训,还能训出世界领先的极低比特模型。

    国产NPU阵营也第一次拥有自己的1.58-Bit低比特训练栈,无需再绕道CUDA验证、迁移。一旦做完,就是基础设施级的沉淀。之后所有面向昇腾的低比特训练,都将建立在同一套底座之上。最终结果显示,整体显存节能约6倍,推理速度快了2到4倍。

    李宇轩介绍,在适配华为昇腾、推进低比特训练过程中,核心卡点主要集中在软件生态与工程调优层面。

    在软件生态上,华为昇腾的编程门槛较高、熟悉其工具链的开发者较少,尤其在长上下文支持方面有欠缺,面壁智能团队为此花费了大量调试时间。

    低比特训练本身也存在诸多工程难点。如果量化器选错,模型效果会断崖式下降。训练流程需要精细调优,必须先做量化感知训练让模型进入稳定收敛态,再引入蒸馏,这个“甜蜜点”需要大量实验才能找到。低位宽模型在某些基础能力上容易退化,需要针对性补数据,用更耐心的方式准备训练集。

    参考面壁智能AI Infra团队的经验,在既有GPU经验积累的前提下,跑通昇腾全链路仍需三周到一个多月,更大模型适配时间会更长。

    此次BitCPM-CANN将多种数据以可复现的方式开源。

    “像OpenAI和DeepSeek,推动全行业做强化学习一样,我们也希望向行业证明,在国产芯片做极低比特训练一样可行。”

    生态议价权

    过去,模型厂商、芯片厂商与终端厂商各自为战。

    模型在英伟达上训练,芯片厂商只管卖算力,终端厂商负责集成。但在端侧AI时代,这条清晰的链条正在模糊,而低比特技术,正成为连接三方的核心纽带。

    对模型厂商而言,低比特技术是核心竞争力。谁能拿出更小、更快、能力保留率更高的模型,谁就能赢得终端厂商的订单。面壁智能开源BitCPM-CANN模型,本质上就是试图建立“低比特模型的标准”,以吸引芯片和终端厂商主动围绕其生态进行适配。

    对芯片厂商来说,硬件已先行一步。高通骁龙8Gen4等旗舰芯片已原生支持2-bit推理。但硬件跑起来,缺的是高质量的低比特模型。面壁智能这样的模型厂商恰好补上了供给侧的空档,让芯片厂商的硬件能力真正有了用武之地。双方深度合作,如面壁智能与华为昇腾,共同优化算子、校准量化参数,形成软硬一体的护城河。

    站在终端厂商角度,低比特模型直接决定了产品的AI体验与成本结构。手机厂商不再只是采购芯片、预装模型,而是需要与模型厂商联合调优,甚至定制专属模型。这种深度绑定,使得终端厂商一旦选定合作方,就难以轻易切换,生态锁定自然形成。

    模型公司与终端厂商的协作,甚至深入到了训练阶段。面壁智能对低比特模型能力损失的商业化处理,就是一个很好的例证。

    用户在手机、汽车上真正高频使用的,是文本总结、语音助手、信息检索这些功能,而不是写代码或解高等数学题。那些冷门能力,绝大多数用户一年也未必用上一次。

    面壁智能正是抓住了这一点,通过后训练,把低比特模型那3%-5%的能力损失,集中到了这些低频功能上。结果就是核心场景的精度近乎完整保留,用户完全感觉不到体验下降,而厂商的成本却实实在在地降了下来。

    现阶段,能够提供稳定、高效、易部署的低比特模型的公司,将在端侧AI生态中占据核心生态位。因为它既是算法提供者,也是芯片优化伙伴,还是终端厂商的AI能力外包方。这种多重身份带来的议价能力和生态影响力,远超传统“卖模型授权”的商业模式。

    关于未来更大的想象来自于,当60B大模型封装进手机,会发生什么?

    目前端侧主流的3B-8B模型,能力大致相当于小学生或初中生,能回答常识问题、做简单推理,但面对复杂逻辑、长上下文、专业领域知识时容易出错。60B模型则完全不同,端侧AI将具备解数学竞赛题、分析法律文书、解读金融报表等专业能力。

    当60B模型完全运行在手机本地时,许多原本必须依赖云端的重任务将变得即时、私密与永远可用。从原来设定闹钟、查天气升级为规划旅行路线、比价购物;从简单补全函数,到生成完整模块、调试bug;从写标题、文案,到能写完整报告等。并且上述所有行为,不联网、不上传数据、零延迟。

    这背后是低比特技术、国产算力与端侧芯片的交汇。算法让模型变小,芯片让模型跑快,内存让它装得下。当这三条曲线同时越过临界点,端侧AI的基建就搭建完成了。

    一旦端侧AI基建就位,超级应用或许也不就再遥远了。

  • 面壁智能,大模型“另类”生存法则

    声明:本文来自于微信公众号 光子星球,作者:郝鑫

    面壁智能,是中国大模型行业中的“另类”。

    在国内外大肆流行Scaling Law(规模定律),即奉行参数越大、数据越多、算力越强,模型能力就越强的时候。

    面壁智能则反其道行之,遵循“知识密度”,即用更少的参数实现更强的能力;以及“密度法则”,即在有限算力下,持续提升模型能力密度。

    一个是“大力出奇迹”,一个是“以小博大”,这注定一开始面壁就与主流的“AI六小龙”走上了不同的道路。

    有趣的是,面壁智能与“AI六小龙”的命运,在无形中形成了一个大写的“X”。交汇点是大模型洗牌期,早期风头无两的零一万物和百川智能,出现了明显掉队的迹象,智谱、MiniMax成功“上岸”,月之暗面和阶跃星辰只差临门一脚。

    在这过程中,面壁智能的处境可以用“夹缝生存”和“逆流而上”来形容。没有打在身上的聚光灯、没有超高金额的融资,面壁智能咬紧“端侧”方向,接连躲过了算力战、价格战和C端流量战。

    保存实力的打法,不仅让面壁智能活了下来,而且也成为了一股不可忽视的力量。

    自2023年4月至今,约三年时间,面壁智能完成了7轮融资,几乎每半年一轮,频率高于多数同期创业公司。

    经过多轮融资后,截至今年4月最近的新一轮融资,面壁智能正式迈入大模型独角兽门槛(10亿美元级别),位列当前中国大模型第二梯队前列。

    大脑 大模型  AI

    “错位”的市场预期

    2023年,Agent对大多数人来说,仍是一个模糊的概念,构成其认知的主要来源来自于学术论文。那一年,关于Agent最热门的话题是“斯坦福小镇”。

    当时,行业对Agent认知到什么程度呢?一个例子或许能说明些问题,有归国的创业者在小型论坛上介绍其Agent创业项目,至少得花一个小时的时间科普Agent的概念,只因为太过于抽象。

    就是在这样的环境下,面壁智能在2023年末,一口气发布了AI智能体应用框架“XAgent”、智能体通用平台“AgentVerse”、多智能体协作开发框架“ChatDev”以及一款AI开发软件。

    在对媒体的闭门交流会上,面壁智能也不得不以,大家更为熟悉的“Copilot”“SaaS”等概念,来解释Agent。以现在的眼光来看,当时面壁智能已经有了Vibe Coding的想法。

    面壁智能相关负责人告诉光子星球,他们判断,“AI Agent是大模型落地场景的重要路径,未来会是Agent的世界,万物都是Agent”。

    电饭锅可以是Agent,放入食材后,根据熬粥的逻辑,自动加热;冰箱也是Agent,如果出现冷却剂故障情况,会通过对话提醒,待确认后预约维修师傅上门。

    电饭锅和冰箱的比喻,核心不是让家电“会说话”,而是赋予它们自主感知、自主决策、自主执行的主体地位。

    这也为后面押注端侧埋下了伏笔,因为“万物Agent”与“硬件端侧”,是灵魂与肉体的关系。没有端侧模型这个肉体,Agent的灵魂只能是游荡在云端,无法干预物理世界的幽灵。没有Agent这个灵魂,端侧模型就只是一个更小的模型文件,缺乏明确的应用指向。

    理想很丰满,现实却很骨感。时间线拉回到2023年,百度文心、阿里通义、腾讯混元大模型在上半年才刚刚发布,下半年月之暗面的Kimi助手也才刚开启内测。

    2024年初,面壁智能开始把重心转移到端侧上,以小钢炮MiniCPM拉开了序幕。用面壁智能CEO李大海的话来说,“以小博大”“以大博聚”构成了面壁智能的核心能力。其核心要义就是要用最少的资源、最小的规模达到最佳的性能。

    截至目前,MiniCPM模型已经更新到了3.0系列,模型参数始终控制在10B以下,且逐步从通用语言模型扩展至多模态、全模态和垂直场景专用模型。

    大模型和小模型是一组相对的概念,如果把“AI六小龙”的战场视为大模型,那面壁智能的主战场始终就在“小模型”上。

    有AI创业者认为,比起参数规模超大的模型,规模在几十亿到百亿的中小模型,更具实用价值。“开源百亿参数的模型,便利中小企业,几十亿规模的模型,几乎开发者都能上手”。而国内模型生态,最缺乏的就是中小模型这块“拼图”。

    两者各有所长,在需要复杂知识推理、长文档分析、专业内容生成的生产力或创作场景中,“AI六小龙”的云端模型不可或缺。但在需要实时交互、隐私保护、稳定可靠的汽车、手机、IoT设备中,面壁的端侧模型则更有优势。

    两者共同构成了,“云端训练大脑,端侧执行小脑”的完整AI产业拼图。

    避开正面战场

    巨头下场,加快了大模型行业的洗牌速度。“AI六小龙”被迫卷进了地狱级的消耗战。

    面壁智能不仅没有被这波浪潮拍打到,反而因为浪潮拍打了别人,凸显了自身的价值。

    不碰千亿、万亿参数模型,相当于主动放弃进入算力黑洞的入场券。其模型运行在客户的手机、汽车和终端芯片上,根本不走云端API计费,因此避免了陷入价格战的漩涡。不做需要日活、月活、留存率的超级APP,既不用花费高昂的市场营销费用,又避开了与互联网大厂的流量碾压战。

    以面壁智能为代表的端侧模型厂商,直击了企业的数据隐私痛点,这成为其核心竞争力之一。对企业而言,涉及关键性和敏感性的数据,不可能直接喂给大模型,特别是大型国有企业。

    还有需要及时反馈的场景,端侧模型的作用远大于通用大模型。拿具身智能领域的场景举例,当人形机器人试图跨过路障时,需要其立即判断该路障的高度、硬度以及应对姿势。此时,模型调用不会发生在公有云上,因为有网络延时,而是通过内置蒸馏的本地小模型,完成及时响应。

    “AI六小龙”的战场是算力密集型,既谁的GPU多、谁的参数大,谁就有话语权。这是互联网大厂和美元基金的主场。

    而面壁智能的逻辑是,端侧战场是能效密集型,即谁能在10亿参数内、50毫秒延迟、100毫瓦功耗的极限约束下,做出接近云端模型的效果,谁就能领跑。这是一个被巨头忽视的技术角落。

    选定战场后,面壁智能开始做巨头不愿做的“脏活累活”。

    有行业人士告诉我们,“芯片和手机大厂在自研端侧模型或模型时,多数只会针对自身产品做优化,这一点上大家是垂直封闭的。”

    面壁智能作为中立的第三方,则可以为所有主流平台提供统一的模型接口和最优适配。对于车企和Tier1来说,这意味着“一次集成,多平台部署,极大降低了开发成本”。

    这一步的核心是用工程苦力构建兼容性壁垒。面壁的护城河不是一行精妙的算法,而是几万行适配代码和对几十种芯片的深刻理解。这种壁垒,巨头不愿意建,小公司建不起。

    成立初期,面壁智能就瞄准了B端客户,从最早的金融和营销领域,逐步扩展至现在的汽车、具身智能、教育等领域。

    值得一提的是,面壁智能的客户多来自于被巨头挤压,但又不想完全依附于巨头的二线玩家。这里面有对抗ARM、英特尔生态,需要独立AI软件栈的龙芯;不愿被华为、小米等智能座舱生态绑定的保时捷;在AI云服务上不想完全依赖于阿里等大厂的中国电信等。

    以上提到的客户名字,均出现在了面壁智能B轮到C轮的融资名单中。通过股权与业务绑定,面壁智能试图把自己变成了硬件产品的一个组件。

    这意味着,只要搭载面壁模型的汽车、手机在出货,它就有持续收入。这就像英伟达的显卡驱动,用户感觉不到,但不可或缺。

    另外,面壁智能还在开拓信创领域。在泛司法、政务、金融等场景,数据不出终端是法律红线。面壁智能的端侧私有化部署能力,使其成为这些领域的合法选项。这不是技术竞争,是合规准入竞争。

    等风来

    技术创新扩散理论提到,一项技术从实验室到产业化中间,存在“概念先行,条件滞后”的经典时间差。

    面壁智能在Agent方面的主张恰好印证了上述观点。2023年的Agent,更像是面壁智能的超前技术宣言,向外界展示了目的地,但缺少了通往终点的路和车。

    2023年的Agent土壤面临着先天性不足,彼时最强的开源模型是LLaMA2,闭源模型是GPT-3.5/GPT-4初代。这些模型虽然在生成文本上惊艳,但在逻辑规划、任务拆解、工具调用、长程记忆这四个Agent核心能力上极不稳定。当时的Agent是“玩具”,不是“工具”。

    彼时,大多数企业还在消化“什么是大模型”。而面壁智能提出的“一句话开发软件”和“多智能体协作”,对应的是高度数字化、流程标准化的理想组织。当时绝大多数企业的数字化基座根本不支持Agent去执行操作。Agent反倒成了空中楼阁。

    现在的面壁智能,能被关注是因为它主动放弃了以Agent为卖点,转而把Agent能力压缩进了端侧模型的“地基”里。

    2026年初,“龙虾”OpenClaw在全球爆发,成为了面壁智能等待的一股东风。

    OpenClaw让市场第一次直观感受到,AI能动手干活了。但用户很快发现,云端Agent存在隐私裸奔、网络依赖、成本高昂三大痛点。

    市场自然产生了一个追问,有没有一种Agent,能断网运行、数据本地处理、还不按次收费?这个问题的标准答案,恰好指向面壁智能深耕三年的端侧Agent方案。

    行业中有专家就指出,未来发展的方向就是端云协同。

    云端大脑利用其强大的全局规划和复杂推理能力,负责长程任务的战略分解、意图理解和最终结果的校验;端侧是手脚,利用其低延迟、高隐私、低成本的特性,在手机、PC、汽车等设备上,负责执行被拆解好的、具体的、短周期的子任务。

    即使这样,面壁智能的头上依然笼罩着估值的阴影。面壁的估值绝对数值并不低,但与六小龙中靠前的几家相比,确实存在明显估值差。

    大模型和端侧模型的想象力固然有差别,但面壁智能所面临的核心问题最终都要归结于:到底是硬件定义软件,还是软件定义硬件?

    面壁智能的端侧模型,在市场上逃不开高通、华为、苹果这些厂商,它们都有自研端侧AI能力,且拥有底层的芯片控制权。关于未来的担忧是,面壁智能是否会重走当年输入法的老路,最终被手机厂商自研方案替代或边缘化。

    这种“被包饺子”的风险,会压制其长期估值倍数。

    面壁智能必须不断证明,自己的算法优势能持续领先芯片厂的内部团队一代以上,才能消除这一折价。