Firefly 端侧大模型 × 实时数字人:让 AI 回答真正“看得见、听得到”
Firefly 在边缘
AI
大模型一体机 AIBOX PRO 设备上成功跑通
Web 大模型调用、VLM 图片识别与 Digital Man 实时数字人
,完成从文字或图片输入、端侧模型推理,到数字人语音播报和画面呈现的完整链路验证。
Web Demo 支持在 LLM 与 VLM 模型之间切换:既能进行文字
问答
,也能上传图片并围绕图片内容提问。这不只是多个应用的简单组合,更直观展现了 AIBOX PRO 异构架构的价值:大模型推理与音视频处理由不同计算模块承担,各自独立运行、并行协作,在一个盒子内完成从“感知、思考”到“表达”的全过程。
为复合型 AI 任务而生
AIBOX PRO 采用双核心板模组与异构计算设计,不同核心模组可以独立工作,并根据任务特点进行分工:

主控 Core-3588JD4
集成
ARM
Mali-G610 MP4 四核
GPU
,并内置可提供 6 TOPS 算力的 NPU,支持主流
深度学习
框架,适合承担系统控制、应用服务、音视频处理和常规 AI 推理等任务。
AI 协处理模块采用 RK1828
,仓库中的 RKNN3 软件栈已列出对 Qwen3-8B、Qwen2.5-VL-7B 等模型的支持,可面向大语言模型、视觉语言模型和多模态 AI 应用进行部署。
在本次数字人 Demo 中,任务分工如下:

大模型推理与数字人音视频链路互不挤占同一处理模块:RK1828 负责生成回答,Core-3588JD4 负责将回答转化为可见、可听的数字人内容。另一个尚未投入本 Demo 的 RK1828 模块,为后续增加 ASR、多路视频分析或其他并行模型保留了扩展空间。
从问答、识图到数字人交互
整套方案采用模块化设计,各环节通过标准
接口
协同工作:

与传统“云端请求—等待结果—播放固定内容”的方案不同,当前 Demo 支持大模型回答的流式处理。模型一边生成内容,数字人一边组织播报,在降低等待感的同时,让交互过程更加自然。

异构并行,让端侧运行更从容
Web Demo 通过 OpenAI 兼容接口调用设备上的 RKLLM3 Server,并支持在页面中切换已部署的 LLM 与 VLM 模型。使用 LLM 时,系统完成常规文字问答;切换至 VLM 后,用户可上传图片并提出问题,图片与文本将一并发送给本地推理服务,由视觉语言模型完成图片内容理解并生成回答。Digital Man 服务继续接收模型输出,将文字回答转化为同步的语音、口型和数字人画面。
在采用本地模型且不调用外部服务时,用户问题和模型推理数据可以保留在设备侧。端侧异构部署还带来以下价值:
减少网络等待
模型部署在本地,减少云端网络往返和网络波动带来的额外等待;
数据更可控
可根据项目要求在本地完成问题处理和模型推理,无信息泄露风险;
部署更灵活
适合展厅、前台、园区、门店及其他边缘场景;
交互形式丰富
同一 Web 入口支持文字问答、模型切换和图片识别,无需额外切换;
任务可并行
大模型与数字人音视频任务可由不同计算模块独立承担;
扩展空间充足
当前仍有一个 RK1828 模块未被本 Demo 占用,可继续部署其他 AI 能力。
实时口型与音画同步
Digital Man Demo 接收大模型生成的文本后,实时完成语音合成、数字人口型生成以及音视频同步输出。当前数字人输出规格包括:

数字人画面通过 Rockit VO 硬件图层输出,充分利用平台多媒体能力;语音数据则通过 Rockit AO 输出,并可根据实际声卡能力进行采样率适配。
Web 端灵活配置与多模态交互
Web Demo 不仅提供直观的聊天界面,还支持模型管理、LLM/VLM 模型切换、图片上传、流式回答和数字人联动控制。部署兼容的 VLM 模型后,用户可直接从页面选择图片,输入“请描述图片内容”“图片中的人在做什么”等问题,由设备侧完成视觉理解与回答生成,再由数字人进行自然播报。

通过环境变量配置
SYSTEM_PROMPT
,还可以快速定义数字人的身份、品牌背景和服务风格。
例如,可将数字人设定为 Firefly 品牌技术顾问:
你是 Firefly 官方数字人,代表公司为用户提供专业、热情、通俗易懂的技术咨询与服务。请将复杂技术转化为用户可感知的价值,并尽量使用适合语音播报的自然表达。
同一套技术底座可以根据场景快速切换为产品讲解员、企业前台、展厅导览员、智能客服或行业知识助手。
可落地的应用场景
数字人可以持续介绍企业、产品和解决方案,并根据访客提问实时生成个性化回答,让传统展板升级为可交流的智能讲解员。
下一步:从键盘问答走向自然对话
当前已经完成:
Web 页面与 RKLLM3 本地大模型联调;
Web 页面支持在已部署的 LLM 与 VLM 模型之间切换;
支持上传图片并调用 VLM 进行图片识别与内容分析;
大模型回答的流式输出;
Web Demo 与 Digital Man 服务联动;
数字人实时语音、口型和画面生成;
基于新会话标识的当前播报打断与内容切换;
HDMI
显示和声卡输出实机验证,代码同时支持
DSI
横屏显示;
Web Demo 支持通过环境变量配置 System Prompt;
后续计划扩展:
接入麦克风和 ASR,实现直接语音提问;
接入企业知识库,增强专业领域回答能力;
利用空闲 RK1828 模块部署独立 ASR 等模型;
将不同模型分配到不同协处理模块,实现更多 AI 任务并行;
对接业务系统、
智能家居
或
机器人
控制接口;
增加多角色、多音色及更多数字人形象。
最终交互链路将进一步升级为:
用户说话 → ASR
语音识别
→ 大模型理解与生成 → 数字人实时播报 → 业务系统或设备执行
让端侧 AI 拥有更自然的表达方式
Web 大模型与 Digital Man Demo 的成功联动,验证了 AIBOX PRO 承载端侧大模型推理、数字人音视频生成以及异构模块协同的可行性,为进一步构建完整语音交互系统提供了基础。
依托 Core-3588JD4 与 RK1828 的异构分工,AIBOX PRO 还可以继续向语音识别、多路视频分析、智能设备控制等方向扩展,并通过更换模块来支持更多样化的模型需求。
未来,我们将继续围绕端侧大模型、数字人、多模态感知与行业应用进行探索,让一个盒子承载更多个性化 AI 能力,也让每一次人机交互更加简单、智能和有温度。
AI
AI
+关注
关注
92
文章
44707
浏览量
305245
Firefly
Firefly
+关注
关注
2
文章
552
浏览量
9345
大模型
大模型
+关注
关注
2
文章
4188
浏览量
5669
