媒体快讯 | 微纳核芯叶乐:存算分离撞上的墙,不如换条路走 | AI 源创50人
发表时间:2026-10-09
网读量:60
原创:
发表时间:2026-10-09
网读量:60
原创:
“世界上并不存在真正的以少胜多。宏观层面的以少胜多,都是无数微观时空维度上的以多胜少累积出来的。”
谈及创新,微纳核芯首席科学家叶乐抛出了这句颇具冲击力的判断。
叶乐是北京大学集成电路学院博导、国家杰青、浙江省北大信息技术高等研究院副院长。在被誉为“芯片设计国际奥林匹克”的ISSCC会议上,其团队连续多年发表十余篇论文,其中一篇获得了2021年度最佳芯片展示奖,另一篇则获得了2023年度最佳技术论文奖,两篇均是ISSCC,自1953年创办70多年以来,国内团队的首次获奖,也是他带着团队从零开拓、啃下硬骨头得来。 而他创业的路线,其实也是一个以少胜多的领域:三维存算一体3D-CIM™新架构,依托 3D 堆叠技术与存算一体,搭配 RISC-V 架构,仅凭22nm制程,就能实现比肩7nm工艺传统架构的性能。凭借这条技术路线,2021 年成立的微纳核芯,迅速跻身 “杭州新八骏” 之列,也稳稳站在了风口上。 趋势明朗之后,大量初创企业拿着存算一体概念奔赴资本市场。据不完全统计,仅2026年上半年,国内存算一体赛道共有10余家初创企业获得融资,累计超40亿元(其中微纳核芯超20亿元)。 可当概念成为资本追捧的热点时,产业落地的距离并没有随之缩短。大量方案底层架构并未革新,却被市场混淆,究竟该如何定义存算一体?存储与计算分离已经数十年,如何破解落地面临的生态壁垒?更进一步,身处弱势的国产厂商,在外部限制之下,凭什么取胜? 在与雷峰网左林右狸频道的对话里,叶乐对这些问题都做了解答,这过程中,他最常提的词不是“算力密度”、”能效比”,而是“信心、方法论、团队管理”,他大量使用军事比喻:侦察兵、大部队、集中优势兵力。比起一位顶会论文作者,他更像一位指挥员。 如果你正在做一件看起来“以少胜多”的事——小公司挑战大公司,年轻人挑战大佬,或者只是想在一条没人走过的路上开出点东西——这场对话值得读完。左林右狸频道: 存算一体技术为何在当下迎来爆发?冯诺依曼架构遇到了什么问题?
叶乐: 这个问题的根本原因在于产业界已深刻意识到,传统架构中“存”与“算”的割裂,正日益成为制约算力发展的核心瓶颈。叶乐:要通俗地理解这个概念,我们可以回溯小学数学。为什么教科书教的是九九乘法表,而不是奥数题里的“鸡兔同笼”?因为奥数只是特定场景下的特定解法,缺乏普适性:它既没有空间普适性(换个问题就失效),也没有人的可复用性(只有少数聪明的孩子能用)。而国与国的竞争,靠的是群体力量,不是几个天才。因此,教科书必须教授普世的、所有人都能掌握的方法论。比如计算 98×26,我们脑子里只需处理个位数的乘法(这是“算”),一旦遇到复杂步骤,就要在草稿纸上写下中间结果(这是“存”)。老师教的打竖式,每一个步骤都是“指令”,串联起来就是“指令序列”。无论多么复杂的数学题,都可以通过泰勒展开拆解为最基本的加法和乘法,然后按部就班地“存算、存算”。这种将计算与存储分离、通过指令序列驱动的方法,极其通用,唯一的代价仅仅是速度慢一点。后来诞生的计算机,正是沿用了这套最基础的逻辑。它摒弃了复杂的奥数技巧,将最基础的运算速度拉到极致,并行度拉到极致。于是,芯片被明确划分为负责“存”和负责“算”的两个部分,中间依靠数据总线进行搬运。正是这套“存算分离”的底层逻辑,奠定了冯·诺依曼架构统治世界的基石。
叶乐:大多数人的数学学习轨迹,其实是一条清晰的认知进阶路线:小学生接触的是“标量”,中学生开始处理“矢量”,而大学生则需要驾驭“张量”。在大学里学线性代数的人都经历过解题的痛苦,解一道题目的痛不在算,而在化简。有时候需要用到一整张或者几张草稿纸来化简, 要把张量化简成矢量、矢量化简成标量,最后才去算。冯诺依曼体系架构做复杂张量计算的时候,就面临数据带宽不够了。AI 时代,中间计算与存储之间的数据搬运成为主要瓶颈,这就倒逼我们用存算一体来缓解带宽问题。
叶乐: 大家并不一定懂存算一体,只是大家都知道现有的冯诺依曼体系架构在新需求下面临的瓶颈是存算分离,所以我们呼唤存算一体。但是存算一体现在也有个不好的趋势,就是有些新概念不严谨。比如说近存:把计算芯片和存储芯片三维堆叠在一起,这叫近存。近存能显著缓解带宽问题,但它的计算和存储还是分离的,那就不是真正的存算一体——因为底层的计算架构没有发生变化,依然是冯诺依曼架构。真正的存算一体是说:计算芯片内部要把分布式的存储和计算融合在一起,把存和算的边界在更细颗粒度上融合,才能解决冯诺依曼体系架构的瓶颈问题。左林右狸频道: 从你开始做存算一体到现在,行业经历了哪些发展阶段?
叶乐: 在推进科学研究和新技术开发的过程中,我们首先需要搞清楚什么是科研探索阶段,什么是集中的、集火式的工程攻关阶段。我们可以把划分这两个阶段的关键分界点,称作“大过滤器”。关于“大过滤器”这个概念,在人类历史和生命起源的讨论中有两种不同的说法。一种说法认为,人类社会已经成功经历并突破了这个大过滤器。在远古时期,地球上有很多物种最终都走向了灭绝,人类的祖先也是众多物种中的一个,但我们成功度过了那次灭绝危机,所以现在才能突飞猛进地发展。而另一种说法则提出,我们其实还没有面临属于人类自己的大过滤器,它没准还在未来的发展道路上等着我们。同样的道理,在做科研和研发新技术时,我们也要分清楚什么时候该放“侦察兵”去探路,什么时候该投入“大部队”。打仗的时候,是不是都要先派侦察兵出去侦察敌情?在科技创新中,侦察兵代表的就是科研探索阶段。在这个阶段,我们要先探清楚这条路到底可不可行、有没有实际用处,在这个阶段是绝对不能盲目投入大部队的。叶乐:当侦察兵探明敌情,确认进攻路线完全可行,并对敌我兵力、地形条件了如指掌,明确知道投入多少兵力、花多少时间就能取胜时,大部队才应投入。这说明,这条新技术路线已没有理论上的风险,剩下的仅仅是工程实施上的风险。面对工程风险,我们可以多投入资金和人力,采取急火式的集中进攻。工程风险即便失败也不要紧,无非是多投入一些人、多花一些钱就能解决。从供给端,也就是技术路线端看:2023 年之前,大家都在讨论用什么存储介质做存算一体,有各种各样的介质。SRAM 在 2023 年突破了理论风险的验证期,通过了大过滤器。还有一些新型存储器的存算一体,我认为也很有前景,但它们暂时还没通过——没通过不代表不行,这意味着还要花时间验证。需求端也有一个大过滤器。2023 年之前,AI 都忙着训练。推理都聚焦于耳机、人脸识别等很小众的传统细分领域。不值得杀鸡用牛刀,用特别牛的颠覆性技术去解决一个耳机和人脸识别的问题,显然不适合。到2023年,Transformer、ChatGPT 出来了,大家发现模型性能越来越厉害,可以商业化地干活了。它的能力已经达到可以取代人类大规模干很多活的时候,推理的需求就来了。而推理的需求来了之后会发现,Transformer 特别适合用存算一体来做,因为 Transformer 里 99% 都是矩阵运算,而存算一体主要就是在原位做矩阵运算加速,整个机会就来了。左林右狸频道:为什么 SRAM 存算一体在 2023 年通过了大过滤器?
叶乐:在供给端,SRAM 存算一体已经全面满足了技术要求。通过多次流片验证,我们不仅成功提升了算力密度,还大幅压低了功耗。同时,我们彻底解决了浮点和低比特浮点计算的技术难题。更为关键的是,我们坚持采用数字域而非模拟域路线,这意味着我们的芯片对算法更加友好,且不存在精度损失。基于上述供给端的成熟条件,我们确认该技术路线已经跨越了“大过滤器”,排除了理论风险。因此,从2023年开始,我们全力以赴,正式启动了前期已预研完整、验证无误的三维存算一体(3D-CIM)技术。目前,我们正面向商业化和产业化,在2024年和2025年全面加速推进。叶乐: 对。做早了你有可能会过不了大过滤器,就打水漂;做晚了可能你就晚了。左林右狸频道: 你早期是做射频毫米波、模拟集成电路出身,为什么会转向存算一体?
叶乐: 我原来是做射频毫米波、模拟集成电路出身。转折点在于,我们研究发现还是得做算力。因为你的感知、最后处理的数据都是给算力服务的,算力占大头,是核心的东西。这是第一点,从需求出发。第二点,我们是做电路设计、做架构设计的,而中国的先进工艺受限。所以我们给自己定了个目标:用相对成熟的工艺做算力,通过架构创新,让成熟工艺可以等效先进工艺的水平。 等中国的工艺水平追上来,先进工艺再叠加架构创新,不就能做得更好吗?这个方案跟当年中国的歼 20、五代隐形战机是一样的思路。20 年前做五代机的时候,我们的发动机暂时落后,比美国落后比较多。美国人因为发动机强,气动布局可以保守,依然能做出非常先进的隐形战机。那个时候我们发动机相对偏弱,就被迫做架构创新,搞了个鸭式气动布局,弥补了发动机的缺陷。等 20 年后我们发动机也赶上来了,两者叠加不就比人家更领先了嘛?所以这也说明一点:暂时的某些环节的落后,恰恰是我们的战略机遇,就看你有没有勇气去挑战它。叶乐: 我们解构、拆解,发现算力里最大的问题是存和算分离。存算分离之后,数据搬运变得非常麻烦,所以要用存算一体来解决数据搬运的问题,提高算力密度。所以我们的构思是:在三维近存的基础之上,再把其中的计算Die,通过存算一体的方式进一步融合——在比特(bit)级别、存储单元(cell)级别,将存储与计算在更细的颗粒度上进行整合。这种细粒度的融合能够显著缩小芯片面积,缩短微观层面的数据传输距离,从而降低时延、提升运算速度,最终实现算力密度的大幅提升。算力密度上去了,其实也就意味着可以用更成熟的工艺等效逼近先进工艺的水平,或者同等工艺水平下,我依然比别人的算力密度更高。整个过程,是需求驱动,加上一种使命感,促使我们往这个方向走。我们也做了接近小十年了。左林右狸频道:存算此前的关注度没那么高,也没有产业化,你为什么这么坚定的走这条道路?
叶乐: 这又是一个把时间维度、把洞察力站得更高的判断。我刚才说,小学生数学学的是标量,中学生学矢量,大学生学张量。计算本质上就这三类计算:标量计算、矢量计算、张量计算。从计算发展的维度来说,张量计算的比重越来越高,标量计算比重越来越小。这就意味着:如何在原位做张量加速,变得非常重要。CPU 本质上仍是标量计算器;而早期 GPU 的核心大核,也仅仅是并行化的矢量计算器,并不具备原生的张量计算模块。面对高阶计算的爆发,传统架构已难以支撑。因此,在存算一体领域的战略布局上,我们的路径非常清晰:要抢占未来算力的制高点,就必须牢牢抓住“张量加速”这一核心。而最高效的张量加速,必须在电路架构的最底层实现“原位计算”。所以我们就专注在真正的存算一体上。左林右狸频道: 有一种观点认为,国外没有制程问题,他们在 MoE、Transformer 架构上天然适配,国内是在做一个国外厂商已经验证过的战场。怎么看?
叶乐: 凡事都有两面性。走传统路线,好处是稳,方向不会错,东西肯定能做出来。但我们必须正视一个现实:国内制程和工艺当前暂时落后。在这种情况下,如果还去跟随国外的架构和生态,那就是以“学生”的身份去打“老师”,架构上打个折,生态兼容方面打个折,工艺方面再打个折,在别人的规则里,我们没有赢的可能。叶乐:唯一的出路,就是因为我们工艺暂时落后,所以必须去蹚一条新路。但这绝不是瞎选,而是需要大智慧。就像1936年毛主席在《中国革命战争的战略问题》里讲的那样,我们必须想清楚:在敌强我弱的这个战场上,我们到底凭什么能赢?第一,需求变了。以前搞云,用户租服务器,我们不知道他干嘛用,所以必须做通用、做碎片化。现在AI时代不一样了,基础模型就那么几个,应用都是长在这些模型上的,我们生产的就是标准化的词元(Token)。既然需求从“五花八门”变成了“少数标准”,那英伟达过去为通用场景打造的那套东西,反而成了它的包袱。边界条件变了,这就是我们赢的第一个机会。第二,劣势能倒逼创新。美国有先进制程,就像当年的英特尔,吃工艺红利,习惯挤牙膏。AMD没有自己的工艺,日子很难,但正是这种压力,逼着它在架构上拼命创新。结果等台积电的工艺水平一上来,AMD反而超越了英特尔。我们也是一样,工艺落后是暂时的,但这恰恰是逼我们在架构上创新的最大动力。现在用架构弥补工艺,等五年、十年后工艺追上来,再叠加我们的架构优势,那就是真正的反超。对企业、对个人都一样。今天你还是个年轻人,业界不认为你是大佬,你要成长,就是以弱变强的过程。企业也是以弱变强的过程。以弱变强、以少胜多,怎么办?这个世界真正存在以少胜多吗?宏观层面的以少胜多,最终结果的以少胜多,都是在微观层面做功夫——微观时间尺度的以多胜少,和微观空间尺度的以多胜少——由无数个这样的以多胜少积累出来的。国产厂商为什么能打败国外大厂,他们虽然几万人,但分布的方向很多。我们发挥存算一体的优势,集中力量在一个特定的时间尺度和一个特定的市场空间尺度,我集中比你强,就有机会一个一个蚕食。叶乐:任何人做事都要谈资源,很多人会说,哎呀,我们小公司怎么弄?大公司资源多。不好意思,大公司资源是多,可他需要干的事情也更多。所以我们永远面对的是时间不够用、资源不够用。如何集中优势兵力,集中在一个单点时间和单点空间上,一击必杀,这是非常重要的方法。今天看那么多团队,凡是过度依赖follow的,赢的可能性就比较小;只有死磕创新的,才有更多赢的希望。左林右狸频道: 这会不会跟整个芯片产业的变化也有关系?
什么是 1.0 时代?就是“Copy to China”。以前我们在美国大厂做过什么,回国就做一个“中国版某某”。借着中美对抗的形势,哪怕我们做出来的东西只有美国版的一半性能,依靠价格便宜,照样有市场、有价值。但现在,1.0 时代的生态位早就被占满了,我们已经做得很好了,老路走不通了。到了 2.0 时代,游戏规则变了。你必须搞原始创新,必须去探索新架构、新方法论,才有机会真正突围。更何况,我们团队是科学家出身,如果还去照搬、follow美国现成的工程方案,那不仅毫无意义,对国家也没有任何增量价值。所以我们要做就做对国家、甚至对全人类有增量价值的东西。这就是开荒的意义和价值。左林右狸频道: 面对算法层面层出不穷的MOE、世界模型等,在产品上我们有哪些规划?
叶乐: 首先不是因为 Transformer 出来了,我们才决定适配 Transformer。我们最开始的判断是,任何模型都逃脱不了标量计算、矢量计算、张量计算这三种的组合。而且任何一个模型的发展,一定是张量计算比重越来越大,矢量、标量的比重越来越小。后来 Transformer 出来了,验证了我们的看法——Transformer 比卷积神经网络时代,张量计算的比重还要高。所以世界模型,你哪怕后面出各种各样的模型,它一定是以张量计算为主导,而张量计算我们都支持。叶乐: 我会抽象出一些基础的标量、矢量和张量算子,这些算子在理论上可以做到完备——在指令集层面是能够做到完备的。那我们在底层把这些完备的指令集做好,再通过我们的算子库和编译器,就能组合出各种各样的应用。所以应用再怎么变,我们都能支持。无非是会发现某些特殊的算子,在某个新的战略性应用里比重更高。那这种算子就不叫特殊算子,它就叫主流算子。针对主流算子,就要专门在架构上做有针对性的优化。但算法再怎么变,我依然能通用支持你。这就是一个不断迭代的过程。叶乐:类似元素周期表,物质那么多,可是化学元素周期表就那么多种元素。 你底层支持了所有化学元素,上层就是通用的。但迭代过程中你会发现:今天氧元素占比高了,那我就专门针对氧元素做一个优化。突然冒出一个新物种,原来只用了一百多种元素,突然加了一个新元素——我不用改我的芯片,我依然是支持的,因为我本来在底层是完备的。但是,如果某一个新元素的比重高了,那我就要特殊地迭代一下,把它加强。所以这就是通用性和专用性的边界,两者可以很好地协同起来。左林右狸频道: 推理一定会成为趋势,但现在商业化落地还是有难点。你觉得最主要的原因是什么?
叶乐: 现在推理场景的市场需求非常旺盛,国内外不少上市公司的业绩表现亮眼。传统GPGPU厂商过去想跟英伟达正面竞争很困难,但现在迎来了一个重要的窗口期。这背后是国际形势的“双向挤压”:美国禁售高端卡,中国又限制采购中低端卡,客观上给国产芯片公司留出了很大的发展空间。但它们面临一个共同的瓶颈:芯片产能不足。传统GPU架构严重依赖先进工艺产能,而国内先进工艺产能又受限于光刻机的突破和保有量。存算一体作为新架构路线,开荒确实需要时间,但迭代速度已经很快:今年已有两款芯片完成流片,还有一款即将流片,预计年底回片,明年上半年开始商业化量产,云端产品后续还会加快迭代速度。左林右狸频道: 目前代工厂的排期情况如何?为什么第一代产品选择深耕 22nm 工艺?
叶乐: 代工厂排期确实很紧,通常优先满足历史订单多的大客户。但我们的存算一体技术不需要去抢紧缺的先进工艺产能——国内成熟工艺产能充足,且我们是在成熟工艺上做高价值量的 AI 大模型推理芯片,这对代工厂来说非常有吸引力。至于选择 22nm,是因为利用我们的技术,22nm 的性能能够接近传统架构 7nm 的水平。鉴于国内先进工艺长期供不应求,充分用好 22nm 不仅能解决产能卡脖子的问题,在当前阶段也具有重大的战略价值。当然,我们也在同步启动先进工艺的流片。基于 7nm 的存算一体芯片,性能将相当于传统架构 3nm 的水平。但在 7nm 产能完全释放之前,22nm 和 7nm 我们会同步推进,以兼顾当下的交付与未来的技术迭代。左林右狸频道: 存和算分开很久了,采用存算一体必然面临生态问题,你怎么看这个问题?
叶乐: 这个问题很难。首先,存储与计算在底层的设计理念和思想是截然不同的,要将两者完美融合,要求团队必须同时精通这两个领域。然而,上层软件生态积累了沉重的历史包袱,无法轻易进行颠覆性改变。为了解决这一矛盾,我们必须在底层硬件与上层软件之间构建一系列“中间层”,通过平滑过渡,让底层的架构变革对上层软件保持透明——即“下层变了,但上层感觉不到变化”。实现这一目标的核心在于指令集与软件生态。为此,我们自主定义了存算一体的指令集。同时,中国 RISC-V 工委会也任命我们担任 RISC-V 存算一体应用组的组长单位,牵头制定存算一体指令集及软件生态的国内与国际标准。叶乐:将上下游串联起来我们需要通过指令集、算子库以及编译器,让上层的通用软件与底层发生变革的硬件无缝衔接。这背后体现的是一种“渐进式兼容”的思想。举个简单的例子:假设两支笔的方向完全一致,我们自然认为它们是同类,可以紧密靠在一起。现在,如果底层硬件发生了改变,方向朝上,而上层软件依然朝下,两者相差 180 度,显然无法直接对接。叶乐:我们可以在中间增加过渡层。先加一层,旋转 5 度,此时两者依然可以被视为同类,因为 5 度的差异微乎其微;接着再加一层,再旋转 5 度。只要我们在中间增加足够多的过渡层来进行翻译和转换,最终就能把原本相差 180 度的两端完美连接起来。通过这种层层递进的过渡,上下游的每一个环节都会觉得“我们好像依然是同类”,从而在不知不觉中完成了整个技术栈的升级与融合。左林右狸频道: RISC-V 的特点是自主,但面临生态碎片化的问题,从别的架构迁过来有迁移成本。
叶乐: 对,但你要注意:我们做的任何东西都要给社会创造增量价值,不是存量价值。在市场竞争中,单纯争夺存量价值往往意味着陷入同质化的“内卷”,这并没有太大的意义。社会之所以奖励创造增量价值的人,是因为他们对全人类和社会做出了实质性的新贡献。如果只是简单地模仿和跟随别人,是无法产生这种价值的。以 RISC-V 架构为例,它确确实实能够实现自主可控,解决“卡脖子”的问题。但对于终端用户而言,他们并不关心底层究竟是 RISC-V、ARM 还是 x86,他们真正关心的是产品是否好用、性能是否优越。如果基于 RISC-V 做出的产品在综合表现上不仅没有优势,甚至落后于传统生态,却试图用“自主可控”的理念去道德绑架用户,强迫他们进行生态迁移,这显然是不合适的。左林右狸频道: 这其实是要根据客户的需求去进行优化。
叶乐:在芯片行业,我们通常用 PPA(即性能 Performance、功耗 Power 和面积 Area/成本)来衡量产品的核心竞争力。如果基于 RISC-V 做出的芯片没有显著的 PPA 优势,客户抱怨生态不好、迁移费劲,这是极其正常的市场反应,我们不能强求。相反,如果我们基于 RISC-V 扩展的存算一体技术,在 PPA 上展现出显著优于传统架构的优势,那么根本不需要我们去劝说,客户自然会抢着与我们适配。任何商业决策,站在客户的角度,本质上都是在衡量收益(Benefit)与成本(Cost)。当客户抱怨“生态难做”时,往往是因为迁移到新生态的成本太高;如果迁移后发现 PPA 并没有带来实质性的好处,他们自然不愿意承担这个成本。但如果收益远大于成本,没有人会拒绝迁移。因此,我们在构建生态时,不能单向地只做兼容。一方面,我们要尽可能做好兼容,通过指令集、算子库和编译器等手段,把客户迁移的成本(Cost)降到最低;另一方面,我们更要把重点放在提升收益(Benefit)上。我们的 RISC-V 三维存算一体技术能够为下游客户带来显著的 PPA 优势,同时我们又在努力降低生态迁移的门槛。当收益被拉高,而成本被压低时,客户自然会愿意使用我们的产品。左林右狸频道: 你曾公开预言,未来每个人的手机可能会有一个大模型。你为什么这样觉得?
叶乐: 关于AI算力的落地路径,我们判断非常清晰:云侧会率先迎来爆发,而端侧的普及则是必然的终局。为什么云侧会先爆发?逻辑很简单:云侧设备是24小时不间断运转的,在新技术初期成本较高的情况下,云侧的投入产出比最大。因此,我们的三维存算一体技术在云侧的推进速度,目前甚至比端侧还要快。但这只是第一阶段。当云侧的算力成本随着规模化应用下降到一定门槛后,端侧就会迎来大爆发。为什么?因为从人性出发,每个人都渴望拥有专属的设备。就像当年有了云端虚拟主机,大家依然需要专属的笔记本和手机一样;未来,每个人也必然希望拥有一个专属的“算力盒子”,只运行属于自己的大模型。除了专属体验,端侧还承载着不可替代的数据隐私诉求。大到企业,不希望核心的研发know-how被云端的基础模型抓取;小到个人,也不希望自己的核心技能被上传云端。这种“数据不出域”的刚需,决定了本地化部署的必然性。当然,端侧的门槛极高。它不能像云侧那样只追求极致性能,而是必须在“性能、功耗、成本”这三者之间找到完美的平衡。
云侧以极致性能优先,满足高并发与重负载需求;端侧则在保障隐私与专属体验的同时,以低功耗、低成本实现普惠。这两条线都会存在,只是各自的侧重点和演进节奏不同。左林右狸频道: 大模型进入端侧,要解决的问题是不是不一样了?
叶乐: 这两者的底层逻辑完全不同。我们必须明确一个核心认知:AI 代表的是智能计算,而当年的笔记本、云端、手机,本质上属于精确计算。回顾精确计算时代,它的演进路线非常清晰:从早期的巨型机,演变成公司使用的小型机,接着是工作站,然后下沉到笔记本、平板,最后普及到手机。精确计算的核心是“1+1=2”,完全可编程、完全基于逻辑推演、结果绝对精确,永远不会出现模糊的答案。而 AI 属于智能计算,它也会重走这条路线,只不过智能计算的起点是云端,云侧先走了一步。但未来,智能计算的工作站、笔记本、手机,其形态肯定与现在的设备不完全相同,整个生态和产业格局都将迎来重大的战略重构机遇。它绝不是原有计算机或智能手机的简单外延,而是一次彻底的范式转移。因此,智能计算的落地一定会遵循“先大端,再小端”的顺序。这里的“大端”指的是工作站、笔记本、个人算力盒子等核心设备;而“小端”则是指各类 IoT(物联网)场景。要想让真正的大模型渗透到小端,还需要花费一定的时间,甚至在某些场景下,小端可能根本不需要承载大模型。叶乐: 在可穿戴设备领域,当前许多智能眼镜正试图在设备内部集成算力芯片以提升算力,但我认为这种做法在现阶段可能缺乏必要性。我们可以设想一种更具经济效益的架构:如果智能手机已经搭载了强大的端侧AI芯片,并能够流畅运行复杂的端侧MoE(混合专家)模型,那么智能眼镜完全可以通过蓝牙等无线通信技术,直接调取手机的算力或者Token。同理,智能耳机、智能手表等可穿戴设备,也都可以作为终端节点,共享并调用手机上的强大算力。这种“以手机为算力中枢,可穿戴设备为感知与交互延伸”的分布式协同模式,不仅避免了硬件算力的重复建设与资源浪费,也是当前技术条件下最具经济效益的解决方案。所以端侧手机上的大模型推理 AI 芯片,不仅可以成为 AI 手机的算力承载平台,也可以作为人的所有可穿戴设备的算力承载平台。这种分布式算力架构极大降低了可穿戴设备的硬件门槛。由于无需在设备内部堆叠高功耗的算力组件,智能眼镜、耳机和手表等产品可以做得更加轻便。当手机具备了强大的端侧算力后,这些可穿戴设备的研发将变得更为简单,从而极大地激发行业的创新活力,加速新产品的涌现。叶乐:手机作为算力中枢,可以通过向眼镜等终端设备提供算力服务(即分发 Token)来获取收益。这种模式类似于设备间的“算力租赁”,例如,当一台新设备接入网络时,手机可以为其提供算力支持并收取一定的费用,从而实现生态内的价值流转。同样的逻辑也适用于家庭场景。未来的无线路由器可以通过增加算力和存储模块,演变为家庭的本地算力中心,用于运行大模型。以扫地机器人为例,无需在其内部加装高昂的算力芯片,只需连接到家庭算力中心即可实现智能化升级。同理,家中的智能冰箱、彩电、门锁及安防系统,都可以统一调用这一家庭级的算力基础设施。这种以家庭算力中心为核心的架构,将彻底重构未来的智能家居生态。左林右狸频道: 你的团队在ISSCC上连续发表十余篇论文,并多次获得大奖,你觉得这其中的原因是什么?
叶乐: 先解释一下 ISSCC。 ISSCC全称为IEEE国际固态电路会议(IEEE International Solid-State Circuits Conference)它以前对国内来说非常难,原因就在于你是个外来者,要去开荒。过去,中国能在ISSCC 发论文的有两类人。一类是中国这边不懈努力,引进了很多海归——他们在国外经历了非常好的锻炼,在国外的科研体系和外国导师带领下,已经具备了发表 ISSCC 的能力,回国后把这个能力带起来了。所以我们的 ISSCC 是完全自己开荒的。 一个是海外学来的能力,一个是在国内土生土长突破的,后者的突破意义可能更大,这也让我们团队极大地增强了信心,能在未来遇到极有挑战性的难题时,有开荒的勇气,有时候,勇气比能力更稀缺。叶乐:研发节奏极快,留给追赶者的时间窗口极其狭窄。每年 2 月底看到上一年发表论文后,9 月初就要提交新一代成果,满打满算只有 6 个半月,且必须比前一年更强。而入选不仅要求原创性和全球顶尖指标,还必须拿出流片结果——流片要 3 个月,测试加写论文又要 2 个月,这意味着真正留给你构思和实现的时间,只有短短 2 个月。备战过程堪称极限冲刺,经常连续两周 24 小时连轴转,对体力、判断力和创造力都是极致考验,但经历过的人能力成长是全方位的。不过我觉得也不必神话 ISSCC ,当前我国在ISSCC领域已经超越美国发文量了,做多了也有套路可循的,我们现在真正的对手已经不是美国发表论文的高校,而是英伟达、高通这些拥有先进工艺流片条件的国际产业界巨头,在工艺劣势下靠创新去挑战他们,才是对我们更高的要求。左林右狸频道: 你是什么时候、什么契机想要创业的?
叶乐: 我骨子里就是想把学术创新成果,转化成产业界有价值的创新产品,后来顶刊顶会发到了头,在国际学术界进入了顶流行列,有了独孤求败的感觉,就更觉得还是该去做产业界的事,尤其是通过创新来为我国产业界做点事情,那样才更有意义、更有价值。左林右狸频道: 现在这一批创业的更多是科学家,是不是时代变了?
叶乐: 这就类似商鞅变法前,世袭制下平民对“军功封侯”普遍存疑。商鞅通过徙木立信,当场兑现五十金赏金,用超预期承诺兑现打破信任赤字,为后续变法铺平了道路。科学家创业同理。寒武纪、智谱等先行者的成功,正是当代的“徙木立信”——当第一个“搬木头的人”拿到赏金,后续科学家才敢相信“他们行我也行”,不仅如此,投资科学家创业的投资机构也获得了显著的收益和继续前行的信心,其他投资人也会说“他们能投我也能投”。左林右狸频道: 你一直反复提到「信心」。做学术跟做产业,你个人感受上最大的不同是什么?
信心不是喊口号,喊口号没有用。 信心是:团队迷茫的时候,你要输出一个战略的方法论,然后严密地论证,你为什么能赢。我举个简单例子:科研更像是参加奥林匹克,而且是单项比赛。 比如你跑百米,某一次奥运会拿到了世界冠军、突破了世界纪录,以后再也跑不出这个成绩,你也载入史册了。可是做产品则更关注其他维度的问题:我这个手机出厂前性能很好,用户拿到手里用着用着变慢了,用户买你单吗?不买。所以在时间维度上:工程、产业取的是时间维度的下限,最差点才是指标;学术取的是时间维度的上限,只要上限突破一次,你就是世界冠军。 这是第一个不同,时间维度方面的不同。叶乐: 第二个是空间维度:科研上是单项冠军,你百米赛跑冠军就行,或者跳远冠军就行。产业不是,产业是各个方向都不能有短板,最终在空间维度的各项指标上取下限。第三点是批量维度:科研只要有一个世界冠军,你这个领域就升国旗了,有一次、一个就行。产业不是,你一批、一万颗芯片、一百万颗芯片,每个都得好。这三个维度的不同点就是:支撑你的底层方法论是一样的,可是你的目标函数和 Benchmark (基准测试)是不一样的。所以你做产业必须导入新的打分表、新的目标、新的边界条件,一定要刷新一次,然后再用你的通用方法论去推进。这是两者最大的不同。很多科学家做产业,没有意识到这一点。左林右狸频道: 是不是有些人天生适合科研,有些人更适合产业?
叶乐: 优秀人才两者都能胜任。很多人不匹配,根源是没看清这里面的差异,导致没办法适配。但是即使认清了,也还是需要给科研人才配套一支成熟强悍的工程团队。全球前沿产业创新,好比站在青藏高原上攀登珠峰,依托已有工程底座才好突破;从零起步,再亮眼的创新也只是平原上小山丘。要分工扬长避短,不要让创新人才耗在基础工程开发上。但把创新思维与工程思维融合组队难度很高,二者底层逻辑本就不一样。做模拟芯片,就像是在湖泊中竞争,多数人满足于维持地位;我们的思路是:在湖泊里拿到盟主地位后,立刻转向大海;在大海里快速成为龙头后,再进入外太空,这就是生态位的跃迁。从学术到产业、从单一领域扩展到多领域,不仅需要勇气,更需具备在陌生环节(如软件、系统)开荒的能力。很多科学家往往只擅长某一环节,但如果缺乏跨领域拓展的魄力与实力,便难以真正做成产业。第一个是团队扩张后,如何把种子成员沉淀下来的方法论持续传导给新人,避免组织因稀释而失去战斗力。与此同时,还要保持与产业界的紧密互动,紧跟快速变化的需求。更关键的是,仅靠内部培养的博士已不够,如何持续吸引外部人才并实现方法论的批量复制。叶乐: 技术上也要跨越。比如我们原来做端侧,只要考虑单芯片;现在做云侧,不熟悉的领域——卡间互联、超节点,以及更复杂的 AI Infra——都要快速跟进,寻找里面哪些是工程问题、哪些是关键的科学问题。工程问题你就找对口的有经验的人;如果是关键的瓶颈问题,就要组织力量去研究。叶乐: 如果你是一个工程团队,原来只会做端侧芯片,所有的优势都来自原来的东家,现在你要做云侧,那自然开不了荒。但我们有优势,我们开荒开惯了,无非就是重新开次荒,我们的强项就是开荒。 如果一定要用一个词来形容叶乐带给人的感觉,估计很多人都会用“通透”这个词汇。 叶乐的表达很利落,回答问题时几乎没有太多的口水词。 与左林右狸频道交谈那天他没做准备,随意发挥的过程,却每个问题都回答得很有条理。 叶乐的履历很清晰:2005年南京大学本科毕业后进入北大,从博士到博士后,再留校任教,与众多顶尖学者共事多年。二十年来,他的研究方向从早期的射频/毫米波、模拟电路,All in转向了存算一体新赛道,在存算一体领域深耕近十年。 2021年,是叶乐创业的时间节点,早于行业两年预判存算一体通过大过滤器,提前适配大模型带来的张量计算。 叶乐身处近年来科学家创业的潮流中,有着一样的学术底色。 但他又似乎有点不同,同一时期很多科学家创业者更多是被时代推着走,风口来了所以创业、赛道热了所以转向,而他直言,自己一开始就没打算一辈子只做学术研究,留校是为了让自己始终保持在技术最前沿,也是为后来要做的事扎根。 从这个角度来看,他更像那个提前站在路口的人,清楚自己要什么,也清楚为此要放弃什么,所以他在热闹里显得有点安静。 叶乐说自己是个兵书和历史迷,在课余时间几乎都用来读杂书,习惯站在更高的时间和空间维度来思考问题。 因此他谈及未来难点时第一个想到的不是技术而是人,技术有解而人无解,这是横在创业面前必然要面对的一道题,也更进一步体现出了他的“通透”与成熟。 最后一个印象和芯片无关——你无论什么时候见叶乐,他永远是乐呵呵的,不是社交场合训练出来的笑,也不是苦撑着的乐观,更像是一个人看清了未来大概长什么样、又确认自己正站在通往那个未来的路上,于是没什么好焦虑的。 而在一个普遍焦虑的行业里,这种乐观或许本身就是一种信号。