36氪专访丨华为诺亚生成式大模型负责人创业家庭具身,一年融了超10亿

图片出处/企业
全文约6900字,建议阅读时长17分钟
作者丨欧雪
编辑丨袁斯来
在华为系具身智能创业公司中,诺因智能属于融资进程较顺畅的一个。
硬氪获悉,这家2025年8月成立的企业,近日宣布完成单笔数亿元人民币天使+++轮融资。本轮融资由京东相关基金领投,正心谷资本、南山战新投和华登投资跟投。距离上一轮5亿元融资,仅相隔一个多月。
在创立诺因智能之前,李银川积累了具身智能、大模型和自动驾驶三方面的研发与落地经验。25岁时,他从北理工和哥大联培博士毕业后加入华为,27岁担任诺亚方舟实验室生成式大模型方向负责人。30岁那年,他离职创办诺因智能。在他看来,家庭机器人是将大模型能力转化为实际产品的关键机遇。
2025年春晚之后,具身智能吸引了资本市场的大量关注。机器人叠衣服、倒咖啡、收拾桌子的视频频繁出现在公众视野中,让外界看到了机器人进入家庭的可能性。然而,从演示迈向日常使用,仍需面对更复杂的挑战:换一个房间、换一套杯碟、换一种家务,机器人能否始终稳定完成任务?
这正是诺因智能希望攻克的问题。李银川回忆,创业初期,行业主要聚焦于工业场景和模仿学习,而他选择了一条以泛化能力为核心、面向家庭场景的技术路线。在他看来,机器人进入家庭需要同时解决适应性和成本问题:模型必须能应对不同家庭中的任务,产品价格也要落在普通消费者可接受范围内。
为此,他们开发了技术底座GLOW,这是一套生成式具身大模型架构。它由多个模块协同,使机器人从“复现训练过的动作”逐步走向“解决未完全见过的任务”。数据方面,诺因90%采用合成数据,整体成本可降低10到100倍;训练方面,世界模型无需生成完整视频画面,也能推演动作后果;执行方面,模型单次推理可输出完整动作序列,降低调用频率。
同时,诺因智能推出了首款消费级家庭具身机器人KNOWIN-X1。它采用全折叠双臂构型,折叠后高度控制在40厘米以内,可适配桌面、地面、沙发、洗衣机等家庭空间。

KNOWIN-X1(图片出处/企业)
当然,这些产品距离大规模落地仍有相当距离。而资本持续注入,部分原因在于诺因智能的人才密度。公司在不到一年内扩展至200人以上。其中,算法团队博士及以上学历人才占比超过三分之二,半数成员毕业于QS世界大学排名前30的院校。团队已聚集多位华为“天才少年”。
对于行业前景,李银川仍持乐观态度。他认为,整个赛道近期可能会有波动,但远未到泡沫彻底破灭的阶段,关键仍在于具身大模型何时出现能力涌现。
对此,业内尚未达成共识。有人认为,机器人行业不会出现类似“ChatGPT时刻”的节点,但李银川认为,智能涌现只是时间问题。
“如果具身模型有一天真正出现能力涌现,机器人的商业价值毫无疑问会远超大语言模型,我认为可能是其10倍以上。”他告诉硬氪。
我们与李银川探讨了创业以来的思考,以及他对家庭具身智能的观察。以下是硬氪与诺因智能创始人李银川的对话。

从华为出来创业
硬氪:当初决定从华为诺亚出来创业时,你是怎么想的?决定性因素是什么?
李银川:我出来创业,主要是想打造一个全球最泛化的具身大模型,真正孵化出商业价值,因此选择了To C具身智能。在华为诺亚时,我觉得如果回去做To B、To G,对具身大模型研发的支持力度会比较有限。华为的战略仍是把昇腾做好,做好“黑土地”,让大家用昇腾,而不是把所有上层应用都自己做。所以我更希望出来做家庭机器人。
硬氪:你当时就想好了要做家庭方向吗?当时是怎么考虑的?
李银川:我当时应该算是国内较早出来讲家庭机器人的人之一。我有两个非共识。
第一,2025年上半年,大家普遍认为具身智能就是操作、模仿学习、进工厂,这是当时的共识。但我当时就在讲,我们要做能够泛化的技术路线,真正做出可泛化的具身模型,而不是过拟合。只有具备泛化能力,才有机会进入To C家庭场景。这是我们在技术路线选择上的第一个非共识。
第二,在了解了当时市场上的机器人售价后,我们有信心通过新的垂直整合方式,把机器人成本降下来。成本降下来,To C才有机会。不能一台机器人卖几十万元,那普通消费者根本买不起。
因为这两个非共识,我觉得这件事有机会,所以决定出来做。
硬氪:你说有信心把成本降下来,具体的判断依据是什么?
李银川:比如具身数据成本,我们测算过,并不是所有数据都需要通过真机操作采集,这一点现在已经逐渐成为行业共识。我们90%使用合成数据,整体成本可以降低10到100倍。
数据成本降下来之后,就是机器人本体。我们核心团队充分交流后认为,通过完整自研,而不是采购别人的零部件进行组装,同样可以把成本做得比较低。
硬氪:你们一直强调模型的泛化能力。但现在家庭机器人的基础能力还没有特别强,这个阶段强调泛化,会不会有些早?
李银川:家庭机器人现在交互能力不强,很重要的原因就是它不够泛化,所以我们才更需要做泛化模型。目前行业里很多架构并没有真正朝泛化去做,而是在比谁能把单点任务做到更好。
大部分具身公司都在发布很酷炫的Demo,但对真正落地考虑得还不够。现在的家庭机器人有点像早期自动驾驶,做出一段特定道路上的效果,就觉得L4、L5时代马上要来了,但实际上中间还有很长的路。
让家庭机器人真正落地,核心是把基础能力做到足够通用。机器人进家最难的,不是完成一次精巧的演示,而是在不同家庭里都能稳定把活干完。这件事最难,所以我们才强调要做最泛化的大模型。
硬氪:那你觉得现在具身智能行业的真实发展水位在哪里?
李银川:整个赛道其实还好。具身大模型还没有到能力涌现的时刻,但一些头部学者判断这个时间不会特别远,有人觉得是一两年,也有人觉得是三五年。
等真正出现能力涌现的时候,我认为机器人赛道的商业价值会比大语言模型更有想象力。现在大语言模型公司的估值普遍比具身公司高一个数量级,平均来看差10倍没有太大问题。它们现在的盈利也没有那么高,只是大家已经看到能力涌现之后比较明确的增长空间。
但如果具身模型有一天真正出现能力涌现,机器人的商业价值毫无疑问会远超大语言模型,我认为可能是其10倍以上。所以回头看,如果具身模型真正涌现,具身公司的估值可能还有非常大的增长空间。
整个赛道近期可能会有波动,但我觉得远没到泡沫彻底破灭的阶段,关键还是看具身大模型什么时候出现能力涌现。
硬氪:为什么你觉得现在整个行业的进展还不够快?
李银川:我觉得现在大部分具身公司,包括整个行业,还不够聚焦。大家一直沿着比酷炫Demo的方向发展,只会把市场预期拉得越来越高,但离真正交付越来越远。
如果行业能更聚焦真正有价值的场景,认真做数据,把数据量做上来,把数据成本降下来,整个行业的发展会顺利很多。
硬氪:这是不是因为大家都觉得,真正落地还很远?
李银川:对,所以这样发展下去,会导致整个行业变得不太健康。
硬氪:现在市场对具身智能的投资逻辑有没有发生变化?投资人会越来越看重什么?
李银川:我觉得很快会发生变化。此前行业处于概念验证和高预期阶段,资本更看重技术前景;但随着产品逐渐走向真实场景,市场逻辑自然会回归本质。
所以未来投资人不会再简单为团队背景买单,而会更看重企业能否真正落地到场景中,并形成可持续的商业闭环和造血能力。
硬氪:具身智能的发展很像在重复自动驾驶的故事。你觉得未来也会走类似的路径吗?
李银川:肯定会有很多相似的地方。自动驾驶公司很多,有坚持做L3的,也有一开始就要做L4的,后来确实出现了很明显的分化。具身公司也会一样。
有些自动驾驶公司一开始就定位做L4、甚至L5,我并不看好。我觉得真正商业价值最大的,反而是早期定位做L3、一步一个脚印往前走的企业。这对我们来说,也有很多可以借鉴的地方。
硬氪:你们是怎么划分机器人智能等级的?
李银川:我们之前定义过L1到L5的智能能力标准。L1更像玩具、遥控和DIY产品,有可玩的商业价值;L2可以完成基础家务,但还是有限、固定场景,比如在固定环境中完成单一任务;L3能够在一个家庭里完成较长链条的任务闭环,人可以处于待命接管状态,让机器人长时间自动运行,把整理、清洁、洗衣等任务做到比较高的成功率,想象空间可以对标一个基础的家庭助手。L4可以进一步对标保姆的大部分能力,L5则是机器人具备更加通用的能力,甚至可以完成很多原本需要人来完成的工作,这就更加遥远。
但机器人并不需要发展到L4、L5,才能产生商业价值。我们重点希望先把L3的商业价值打穿,同时持续向L4探索,验证模型的泛化能力。但现阶段过早孵化L4的商业价值,还是比较困难的。
硬氪:L4的想象空间主要在哪里?
李银川:如果真正做到L4,可能需要充分对标一个保姆的大部分能力。
但实际上,大部分消费者买机器人时,对机器人的期待并不会像对保姆一样高。如果售价不贵,能够稳定帮忙做一些家务,已经可以产生很大价值。
比如扫地机器人,大家的期待其实很明确,它能把地扫干净就可以了,但一样形成了很大的市场。如果机器人能够把很多家务做好,商业价值就已经可以孵化出来。
同时,家庭场景中的能力还可以向外辐射到一些半To C场景,比如迎宾、递水、陪伴,以及其他商业场景,并不一定需要完整达到保姆的能力。
而如果真的要像保姆一样收拾家庭,对速度、成功率,甚至做饭等能力,要求就会高很多。
硬氪:如果先做专用或特定场景,再逐步走向泛化,这条路径会不会更现实?
李银川:从技术路线来看,做专用能力对做泛化能力的帮助其实不大,两者的技术差异非常大。
有些公司可能先做专用模型,把商业价值跑通,赚到钱之后再去孵化泛化模型。从商业路径上看,这当然可以理解,就是先做简单的事情赚钱,再做复杂的事情。但从技术路线演进来看,我觉得它并不是一条自然的路径。
做过拟合的系统和做大模型,本质上是两件事。语言模型十年前就能写诗,很小的LSTM也可以写古诗、背诵内容,但真正到今天的大模型才产生巨大的商业价值。原因是它具备了更强的推理能力,能够理解人的意图,也足够泛化,生产力才真正被释放出来。
具身智能也是一样。如果大家一直拼命做过拟合场景,把所有工程师都投入到单点任务的工程交付里,这些能力不会自然沉淀到通用模型底座里。从技术路线来看,它对最终的泛化模型帮助并不大,只能说可以提前产生一些收入。
硬氪:那诺因怎么在坚持泛化路线的同时,解决商业化和收入问题?
李银川:这也是我们正在持续解决的问题。我们已经找到了一些方法,在坚持泛化大模型长期目标的同时,沿途不断找到商业价值。
并不是一定要卷过拟合场景才能赚钱。同样是在消费级、To C的很多场景里,只要能力做得足够泛化,就会有很多场景可以适配我们的机器人,我们也可以找到中间的盈利点。
只要商业模式能够跑通,我们还是会坚持走最泛化的技术路线。
硬氪:你说的中间盈利点,可以具体举个例子吗?
李银川:比如我们现在主要在做整理、清洁、洗衣这样的家务机器人,同时也可以寻找这些能力在其他场景中的应用。
硬氪:具身智能距离真正大规模商业化,还需要跨过哪些关键难关?
李银川:现在只能说,我们已经把这条路线的可行性初步跑通了。比如数据降本、本体降本,以及模型泛化能力,都得到了一些验证。
但真正做到量产,以及达到非常高的作业成功率和商业化标准,都还需要持续攻坚。

更务实的世界模型
硬氪:业内对合成数据一直存在一些质疑,你们怎么看?
李银川:合成数据关键还是看怎么用。首先,生成的数据质量够不够高;其次,数据有没有真实标签,标签够不够准确,这些都是挑战。
如果这些问题能够解决,我们对基础家务场景做过测算,合成数据的能力是足够覆盖的。
硬氪:用合成数据训练出来的模型,和真实家庭环境之间会不会存在较大差距?
李银川:主要还是看生成引擎和模型架构本身。我们生成的场景和真实家庭已经比较接近,不是传统意义上那种纯仿真数据。更重要的是,不同模型路线对Sim-to-Real的敏感程度并不一样。传统模仿学习更强调拟合人类真实操作轨迹,如果仿真中的动作轨迹、接触和动力学与真实世界存在偏差,模型就容易把这些偏差一起学进去。
我们的路线不是简单复现一条真实轨迹,而是通过统一的自回归模型,把视觉、语言、空间关系和动作统一建模,让模型先理解当前世界状态、任务目标和动作结果,再生成新的动作。因此,合成数据更重要的是提供准确的空间关系、物体状态、动作结果和训练标签,而不是要求每一条轨迹都和真人操作完全一致。最后再通过少量真实数据和真机执行反馈持续对齐,进一步缩小Sim-to-Real的差距。
硬氪:后续会考虑自己采集真实数据吗?
李银川:会考虑,我们现在也在自己采集一些数据,包括Ego-Centric第一人称视角数据等。但比例比较小,我们没有大规模去做需要真人操作的真机数据采集。
硬氪:在诺因的GLOW架构里,你认为哪些能力尤其重要?
李银川:我们在GLOW里面,比较早地把一整套世界模型和具身大模型框架梳理清楚,并完整地组合起来使用。大致可以分成三类。
第一类,是以前做视频生成的公司或者学者在做的世界模型,通过视频生成去生成真实世界。在我们这里对应KnowinDream。我们没有把它直接叫

