对话Soul CTO陶明:一家社交公司为什么要做TOB和硬件?
今年世界人工智能大会(
WAIC
)期间,
Soul
的展台上,两样东西吸引了全场焦点:一个是灵巧互动的
“
实时数字人
”
,一款名为
“
B Soul
”
的
AI
硬件。
后者尤其引人注意。在人人都争抢
AI
原生手机
、
AI
眼镜等
“
下一个入口
”
的这一年,
Soul
拿出的却是一个不能替代手机
的
小东西
——
外形圆滚滚,像徽章,像手表,又像电子宠物。
这很难不让人好奇:一家以
“
灵魂社交
”
起家的公司,为什么要做硬件?甚至还开始大举进军
B
端市场,将其沉淀的技术实力,对外输出成一整套包含模型、记忆系统、合规模块的
“
场景解决方案
”
。
过去一年,
Soul
动作频频。十个月内,
Soul
接连开源了六款模型,并取得了不错
的
成绩:播客语音合成模型
SoulX-Podcast
登顶
HuggingFace
TTS
趋势榜;实时数字人生成模型
SoulX-FlashTalk
首次将
14B
数字人做到
0.87
秒亚秒级超低延时;轻量化的
SoulX-FlashHead
能在单张
4090
显卡上跑出
96
帧的工业级速度;今年
6
月,
Soul
开源的端到端多人对话转录模型
SoulX-Transcriber
,在多个会议数据集上跑赢了主流商用模型。
在开源社区积攒的声量,成为其技术实力对外商用的底气。这也要求他们往技术的深水区扎去,其自主研发的
SoulX
实时多模态交互
技术体系
,主打面向下一代人机交互场景,不追求通用大模型的
“
无所不知
”
,而是一头扎进了实时理解、情绪感知、语音优先的人机交互方向。
一家社交起家的公司,怎么在
AI
浪潮中寻求自己的全新身位?又想对外展现出怎样的区别于其他模型厂商的差异化能力?在
2026
世界人工智能大会(
WAIC
)前夕,
Soul CTO
陶明接受了凤凰网科技
《浪潮》
栏目的独家专访。这是他首次对外系统地讲述
Soul
从
App
走向硬件、从
To C
走向
To B
的战略逻辑。
谈及
调整
之难,
陶明
在访谈中
坦
言
“Soul
面临的品牌认知困境
”
,所以要做整体的战略升级。
“
想让大家知道的是,
Soul
是一家模应一体的公司。我们以
SoulX
为载体,一方面赋能我们的社交业务,不断提升
SoulX
本身的效果能力;另外一方面,把
SoulX
延展到产业链上去。
”

陶明还透露,过去一年间,Soul内部的工程师已不再被鼓励“手搓代码”。“变革这个事,不存在平滑的、缓慢的变革。缓慢地去变革,你已经跟不上了,一定要激进。”
在堪称
“
激
进
”
的
摸索
过程中,陶明
坦承
,做硬件的确也
“
踩了很多坑
”
,指出曾经认为
“
做
To B
一定是赔钱的
”
的观点盲区,认为
Soul
的破局之道在于走出一条极致差异化的路径:把硬件做成
IP
载体,把
To B
生意做成场景化的交互解决方案,并谨慎地试探
AI
与人之间那条模糊的互动边界。
以下是凤凰网科技《浪潮》与
Soul CTO
陶明对话实录,经过不更改原意的删改:

关于硬件
“
B Soul
”
:不是为了做硬件,而是为了让连接走出屏幕
凤凰网科技:今年
WAIC
大家都在争线下终端,
Soul
做
“
B Soul
”
这款硬件的思路和初心是什么?
陶明:
我们的出发点和他们不太一样。很多模型公司做硬件,是追热点,找模型的应用方向。
Soul
的出发点,是想把我们
App
里随时随地的情绪价值连接,延伸到现实社会里来。过去,你打开
Soul
,就能体验到这种连接;但关掉手机,你的现实和虚拟世界就完全割裂了。
我们最初想,这个硬件是不是要把
App
里的关系迁移出来?后来想开了,用户要的是一个纯粹的体验,
Soul App
是独立的,这个终端是另一个独立的体验空间,两者不
是必须
要连接。
“
B Soul
”
不是手机的替代,而是一个能感知情绪、随时在场的交互入口,是一个人机交互的陪伴工具。

凤凰网科技:如果不是手机的
“
替代品
”
,这款硬件最终如何定义自己,目标用户是谁?
陶明:
我们只定义它能给用户带来什么。它可以作为日常的情感陪伴工具,可以当作一个
个性表达、
潮流的
IP
配饰,类似胸针、手表,核心用户还是年轻人。但最重要的是,我们未来会在里面投放大量的
IP
角色。我们卖的不是硬件,是
IP
。
比如,
你可以和迪士尼
IP
、我们自有
IP
的角色对话。就像大家买泡泡玛特,买的不是那个盲盒,是盲盒背后的
IP
。
未来硬件里会内置虚拟人,用户
也
可以自己去构建喜欢的虚拟人,可以自定义音色,有语音交互的能力,还有一些工具层面的,比如哄睡这些。
凤凰网科技:在国内做硬件是场硬仗,一定会面临的一个问题是,华强北做了怎么办?
陶明:
按照原来的这种硬件思路去做,你肯定会担心,因为你只要卖
得
好,你的硬件一定会被
copy
。现在国内大量的
AI
硬件其实都在海外拿到了收益,但
在
国内
很难
。
所以我们的思路是,一定要把
IP
和硬件结合起来。卖的不是硬件,我卖的是
IP
。你的差异化路径要打好,
IP
不是其他公司能够去替代的。我们自身其实也在发展
IP
,现在
Soul
有的虚拟人在全网有几百万的粉丝,
它们
也会入驻到我们的硬件里面。这些粉丝都是我们硬件的
潜在
购买
者
。
坦白讲,
硬件
要做
得
一模一样其实很简单。但我们有独有
IP
,再加上自身模型的解决方案,就构建了无可替代的差异化。
凤凰网科技:做硬件的思路跟做软件完全不同,你们在这个过程中踩过什么坑?
陶明:
肯定是踩了很多坑。软件更多时候是快速上线、快速迭代,线上反馈。硬件最开始我们想的是,不找代工厂,自己绕过供应商去采购硬件,自己做解决方案。后来发现根本没有办法,对下游供应商的品控也很难,甚至都不知道该怎么动手。也想过找一个团队来做,后来发现还是没有这个基因,最后还是委托给第三方的供应商。
未来如果要再发硬件,也不会自己构建团队去做,还是交给合作伙伴。我们还是做擅长的事情,把软的方面、交互模型解决方案做得更好。
凤凰网科技:你们对出货量有预期吗?
陶明:
我们有大的预期,但像有的公司卖硬件风格比较粗暴,就是价格打到最低。
Soul
还是不太一样,我们这款
会有差异化的
定价
考虑
,我们卖的不是硬件,卖的是
IP
。

“
情绪感知
”
的技术内核:我们要的不只是一个
“
问答机器
”
凤凰网科技:外界对
Soul
的认知还是一家社交公司,但你们也推出了自己的交互模型
SoulX
,很强调情绪感知与交互,这和追求
“
智能
”
的通用大模型,在技术实现上有什么不同?
陶明:
这完全是由我们要达到的效果决定的。第一,我们要呈现的感知交互是完全符合人和人行为的范式的。所以在交互方式上,不是一来一回,
而是
随时可以互相打断;第二,它必须有非常强的情绪感知,不只要理解你说了什么,还要感知你的情绪,并决策以什么情绪回复你。
为了实现这一点,我们的训练数据不仅是语料,更有海量的
合规
“
行为语料
”
,比如说话的断点、副语言,语气词等。这使得它能理解语言背后的情绪,而不仅仅是文字逻辑。
凤凰网科技:
SoulX
主打
“
语音为先、面向多模态
”
为技术内核,为什么如此强调
“
语音为先
”
?
陶明:
视频交互信息密度最大,但用户的行为成本高。文字简单,但信息密度低。语音是兼顾了低成本和高信息密度的最普适的方式。人在说话时,语音能表征的东西远比文字多,这反而让技术处理难度更大。但我们的重点不是单纯的语音克隆,而是在语音基础上加入了强大的情感、情绪感知。这是我们跟市面上其他语音模型最大的差异化。
凤凰网科技:
Soul
构建了
“
自有应用
—
产业生态
”
双层应用体系,那
Soul App
作为模型迭代的试验场,在数据反馈和场景验证上,能带来什么优势吗?
陶明:
通用模型其实无所谓人机交互的沉浸度,或者考虑
人与
AI
交互的
边界问题,就是吸引用户不断地去内容消费。但对
Soul
来讲
就不一样
,
所以
这个周期是非常非常长的,这是我们跟其他公司不太一样的地方。我们产品很早就构建起来了,但推进速度会很慢。
这还是得益于,
Soul App
本身还是要以人和人的交互为主
、
人机交互为辅。所以这次战略升级也是基于这样的考虑,有必要把
Soul App
和要去做人机交互入口分开来,彼此之间不会耦合得那么紧。

从
To C
到
To B
:
“
做
To
B
很容易赔钱
”
,但我们找到了差异化的解法
凤凰网科技:
Soul
正从社交平台转向
“AI
生态公司
”
,你们也想要把
SoulX
的能力对外开放给
B
端,这种转变是如何发生的?
陶明:
我们
2019
年就开始做生成式
AI
,但直到
2023
年后,我们发现人才市场并不认为
Soul
是一家
AI
公司,这很吃亏。所以我们开始陆续开源模型,最初是为了吸引人才。但意想不到的是,开源后在产业端引起了巨大反响,机器人、陪伴、语音对话等领域的客户都找上门来,希望我们提供方案。
但当时行业共识是,单纯做
ToB
,要么是竞标,交付难、账期长;要么是卖
token
,都在卷价格,做一单亏一单。后来我们决定做,就要走差异化路线。
凤凰网科技:
Soul
差异化的
ToB
打法是什么?
陶明:
我们只定位在人机交互的场景,并且是需要情绪感知的场景,比如具身智能、智能座舱、内容演绎(如
AI
漫剧)。我们不只是一个模型
API
提供商,而是提供一整套包含模型、记忆系统、合规模块的
“
场景解决方案
”
。
在商业模式上,我们也更开放。我们不会大规模采购算力,而是选择与算力中心合作,把模型部署在他们那里,客户使用时我们只参与分成。这样我们只有毛利,没有沉重的算力成本。
这个模式在国内跑通后,
明年上半年我们就会转身去做海外,推出英文版模型
。
凤凰网科技:你们会把谁在这个领域中视为竞争对手?
陶明:
其实并不能算是竞争对手,因为大部分还是通用模型玩家
,
但细分下来,
我们
做的还是不太一样。差异化的点在于,他们更多只是提供
API
,我们提供的是场景解决方案。第二个是成本优势。第三个,也是我们觉得语音交互里面最重要的,叫做音色
IP
。这是最重要的声音资产,我们相比其他家会有庞大的
IP
库。
我们希望,普通的用户能够在我们的平台上上传自己的音色
IP
。当他的音色被客户选择过后,能得到一个很好的分成。因为
Soul
本身有很大的语音场景,我们天然就有很多好听的音色
IP
,这个解决了非常大的痛点,现在不管是
AI
漫剧、
AI
短剧,还是短剧配音,都需要丰富的音色
IP
。这跟卖脸不一样,卖脸是卖一次性的,
未来,
卖我们的
IP
库是持续性的,基于
Token
分成。

AI
在社交中的边界:
“
我们故意让
AI
不完美
”
凤凰网科技:
Soul
这次在
WAIC
还
展示
了
SoulX
实时数字人,它相比于前几年我们看到的数字人有什么新进步?
陶明:
技术路线完全不一样。原来的数字人是驱动式的,对整个人进行建模后,通过动作标志来驱动模型,你会发现它很机械,也没什么表情,可能能做
200
套动作,但一点都不丝滑。现在我们完全是基于生成式的模型技术来做的,并且是实时的。
我们希望未来在虚拟空间里面,逻辑上有一个自己的连接体存在,或者有一个交互对象在,它是能显示的
、
有形象的
、
有性格的。这是交互的最高层面,我能看见你,你也能看见我,交互体验是更沉浸式的。
普通用户用自己一张照片,上传一下,就可以让它动起来了。当前我们所展示出来
的
能力,并不
是
单纯只能做陪伴类的,更多的还想释放在产业链上,比如做数字人直播。原来的数字人直播还是要靠人后面去做动作,要么是录播的,要么是基于录制式驱动的。实时交互的,我们在国内应该算
是非常早进行探索的
,
也
已经开源出来了。
凤凰网科技:数字人要做到实时交互,技术难点是什么?
陶明:
主要是时延的问题,以及时延和效果怎么平衡。你要它非常丝滑,生成效果要好,同时不能感觉一帧一帧跳动,那就要求时延一定要低。
而且,模型体积一定不能大,不能说我构建个
大规模参数
的模型来做实时数字人,那肯定不行。至少
1
秒
32
帧,
大规模参数
的生成不了,或者成本很高。我们只能在几
B
的模型上把它构建起来,这就要求我们的表征、隐空间、量化要做得更精细。当前来看,我们是
行业里比较少
在这一块能够达到这样效果的。

凤凰网科技:怎么把成本控制在可控范围?
陶明:
实时数字人方案还好,因为它是小
B
模型,单卡
4090
上就能跑。我们因为一直主打的是实时,实时要求算力的密集度会更高,所以只能说一开始你的方案就应该是低功耗、低成本的。不算好的话,即使用
大规模参数
构建出这样的技术,也没有办法场景化,没办法持续迭代效果。从一开始就要把账算好。
凤凰网科技:
AI
虚拟人容易让人沉迷,
Soul
在产品设计上如何把握边界?
陶明:
在
Soul
的生态构建里,包含几个方面,一个是用户体验,第二个是用户安全,第三个是内容安全。我们是从移动互联网下半场才进场的,
201
6
年底。那时候监管其实已经慢慢开始治理了,我们从那个时候开始就相当于
跟
着监管一路走到现在。
我们现在的思维是会更未雨绸缪,提前发现问题,前置地去构建解决方案来规避。所以从上线初开始就很克制,没有主动的入口,到现在为止,
平台
没有交互过的虚拟人
不会
主动去触达用户。
我们的理念是,即使技术能做到完美,我们也希望
虚拟人
是个
“
不完美
”
的状态。如果一个
AI
什么都应和你,太完美了,在现实生活里,这可能就是一个有目的的
“
杀猪盘
”
。
所以我们希望在交互中通过这种不完美,让用户不只看到虚拟提示的标识,而在聊天过程中就本能地感知到,保持清醒,不要太沉浸。
技术层面,我们有独立的
AI
安全模型,对用户输入和
AI
输出进行双重审核;产品层面,我们有显著的
AI
标识,当用户与
AI
连续对话达
2
小时,系统会强制弹出提醒,建议休息。这都是我们生态治理的一部分。
凤凰网科技:
AI
的介入,会冲击
Soul
主站
“
人和人社交
”
的根本吗?
陶明:
在
Soul
上,我们一直坚持
AI
为辅,人和人的社交才是根本。目前的数据反而证明,
AI
在促进人和人的社交。很多原来社交能力不强、表达羞涩的
“
低活
”
用户,在跟
AI
聊天的过程中,社交思维被
“
训练
”
出来了,变得更愿意、也更有能力去跟真人交流。这形成了一个正向的飞轮。
AI
在
Soul
里是一个工具,当这个工具和我们个性化、影响力驱动的社区场景结合时,它的商业能力就体现出来了。这就像在雨水多的南方卖雨伞,才能卖出好生意。同样的
AI
工具,在不同的社区土壤里,长出的商业果实是完全不一样的。

战略转身与未来:希望成为人机交互的
“
基础设施
”
凤凰网科技:你们内部现在用AI写代码的比例高吗?
陶明:
AI coding是大趋势,我们现在技术团队是不鼓励工程师手搓代码。前段时间刚举办了AI创新竞赛活动元创营,普通员工也往这条路上走。
因为变革这个事情,它不存在很平滑的、缓慢的变革。如果说缓慢地去变革,那你已经跟不上了,落后了。你一定要激进。在激进的过程中会有个好处,迫使大家的思维硬转过来。缓慢的话,大家的思维惯性是存在的,他认为还有时间。硬转的过程中,就不得不换个思维来面对这个事情。
凤凰网科技:会有风险吗?AI写的代码出问题怎么办?
陶明:
非常有啊。但这不是
AI
的问题,是你本身要构建一个
pipeline
,尽可能保障
AI
写的代码是合乎要求的,是能够正确的。因为不可能说未来
AI
写的代码都是
100%
正确的,尤其是复杂工程里面。所以无论如何都需要构建
pipeline
来保障它。为什么现在
Agent
技术起来后,对
AI coding
这个事情也有非常大的促进作用?它也是解决方案的一种方式,我可以给
Agent
更多的
skill
,可以让
Agent
去
loop
地写代码,去做
cross check
,这都是人要去设计的。
凤凰网科技:外界印象中
Soul
是一家社交公司,但这些年感觉越来越像一家
AI
公司,这个变化是怎么发生的?
陶明:
其实
在
去年之前,我们还定位在
Soul
是一家社交公司。虽然大家对
Soul
的
AI
感知蛮深刻的。一方面
Soul
本身的
SoulX
,在
Soul
里面的产品赋能和效果,用户是能够看得到的。另
一方面
我们也开源了五六款模型,在社区里面也达到了比较好的反响。但即便大家知道
Soul
里的
AI
做得很好,但市场也好
、
用户也好,把
Soul
定位成一家
AI
公司,还是比较难的。
所以说,今年我们做整个战略升级。未来对外更多想传递的是,
Soul
其实是一家模应一体的公司。我们以
SoulX
为载体,一方面赋能我们的社交业务,不断
提高
SoulX
本身的效果能力;另外一方面,把
SoulX
延展到产业链上去。未来更希望被视为一个
AI
生态公司。原来的社交只是这个生态中的一部分。
凤凰网科技:从社交公司到
AI
生态公司,战略升级过程中,让你最焦虑的是什么?
陶明:
Soul App
本身的稳态发展已经很成熟了。新的
ToB
业务承载着我们未来极大的想象力,当前让我焦虑的是,我们能否真正给客户带来实际价值。我们虽然通过推演找到了差异化路径,但还需要时间去实践。我们面对的客户是产品提供方,他们背后才是终端用户,我们隔了一层,如何确保我们传递的价值是真实有效的,这是经营思维转变中最大的挑战。
凤凰网科技:
Soul
最终希望成为一家什么样的公司?
陶明:
我们希望定义为
AI
生态公司。未来的物理世界,
AI
的入口不一定只发生在手机上,会是多个差异化的硬件。我们希望成为所有这些需要
“
情绪感知交互
”
的硬件终端背后的主要服务商和基础设施提供商。
我们
不久
也
会公布更多的进展
,大家会看到,大部分具身智能、智能座舱的品牌,都
可能
是我们未来的战略合作伙伴。我们的目标是,有情绪感知交互需求的地方就有
Soul
的解决方案。
从技术上看,
我们
最近发布的
SoulX-
LiveAct
模型就让我很兴奋,它标志着我们迈出了实时多模态交互的重要一步
。接下来
已经不只
是
单纯的数字人,
而且
能识别我的动作。比如我端起水杯喝口水,我们就希望屏幕里的数字人也能意识、识别到。它正在让交互从单纯的情绪生成,走向意图理解与形态表达的结合,这是未来非常有想象力的方向。(转载自凤凰网科技)
