×

端侧大模型 × 实时数字人:AIBOX PRO 让 AI 回答真正「看得见、听得到」

2026-08-12

边缘 AI 大模型一体机 AIBOX PRO 成功跑通 Web 大模型调用、VLM 图片识别与 Digital Man 实时数字人,完成从文字或图片输入、端侧模型推理,到数字人语音播报和画面呈现的完整链路验证。

Web Demo 支持在 LLM 与 VLM 模型之间切换:既能进行文字问答,也能上传图片并围绕图片内容提问。这不只是多个应用的简单组合,更直观展现了 AIBOX PRO 异构架构的价值:大模型推理与音视频处理由不同计算模块承担,各自独立运行、并行协作,在一个盒子内完成从「感知、思考」到「表达」的全过程。

为复合型 AI 任务而生

AIBOX PRO 双芯片组合:Rockchip RK3588 + RK1828
AIBOX PRO 双核心板模组:Rockchip RK3588 + RK1828 异构计算

AIBOX PRO 采用双核心板模组与异构计算设计,不同核心模组可以独立工作,并根据任务特点进行分工:

  • 主控 Core-3588JD4 集成 ARM Mali-G610 MP4 四核 GPU,并内置可提供 6 TOPS 算力的 NPU,支持主流深度学习框架,适合承担系统控制、应用服务、音视频处理和常规 AI 推理等任务。
  • AI 协处理模块采用 RK1828,仓库中的 RKNN3 软件栈已列出对 Qwen3-8B、Qwen2.5-VL-7B 等模型的支持,可面向大语言模型、视觉语言模型和多模态 AI 应用进行部署。
AIBOX PRO 任务分工:Core-3588JD4 主控 + RK1828 模块 A/B
AIBOX PRO 三模块任务分工示意

在本次数字人 Demo 中,任务分工如下:大模型推理与数字人音视频链路互不挤占同一处理模块——RK1828 负责生成回答Core-3588JD4 负责将回答转化为可见、可听的数字人内容。另一个尚未投入本 Demo 的 RK1828 模块,为后续增加 ASR、多路视频分析或其他并行模型保留了扩展空间。

从问答、识图到数字人交互

整套方案采用模块化设计,各环节通过标准接口协同工作:

环节 处理模块 关键能力
输入 Core-3588JD4 Web 页面接收文字或图片
模型选择 Web 前端 在 LLM / VLM 之间动态切换
大模型推理 RK1828 模块 A 调用 RKLLM3 本地大模型 Server
结果生成 RK1828 模块 A LLM 完成文字问答 / VLM 理解图片并生成回答
数字人合成 Core-3588JD4 Digital Man 接收回答,按句生成语音、口型、画面
输出呈现 Core-3588JD4 Rockit VO/AO 输出 HDMI 画面与音频
AIBOX PRO 端到端交互链路流程图
AIBOX PRO 端到端交互链路:从用户输入到数字人输出

与传统「云端请求—等待结果—播放固定内容」的方案不同,当前 Demo 支持大模型回答的流式处理:模型一边生成内容,数字人一边组织播报,在降低等待感的同时,让交互过程更加自然。

异构并行,让端侧运行更从容

Web Demo 通过 OpenAI 兼容接口调用设备上的 RKLLM3 Server,并支持在页面中切换已部署的 LLM 与 VLM 模型。使用 LLM 时,系统完成常规文字问答;切换至 VLM 后,用户可上传图片并提出问题,图片与文本将一并发送给本地推理服务,由视觉语言模型完成图片内容理解并生成回答。Digital Man 服务继续接收模型输出,将文字回答转化为同步的语音、口型和数字人画面。

在采用本地模型且不调用外部服务时,用户问题和模型推理数据可以保留在设备侧。端侧异构部署带来以下六大核心价值:

核心亮点 价值说明
减少网络等待 模型部署在本地,减少云端网络往返和网络波动带来的额外等待
数据更可控 可根据项目要求在本地完成问题处理和模型推理,无信息泄露风险
部署更灵活 适合展厅、前台、园区、门店及其他边缘场景
交互形式丰富 同一 Web 入口支持文字问答、模型切换和图片识别,无需额外切换
任务可并行 大模型与数字人音视频任务可由不同计算模块独立承担
扩展空间充足 当前仍有一个 RK1828 模块未被本 Demo 占用,可继续部署其他 AI 能力
VLM 多模态交互 Demo:识别温度计图片并由数字人播报穿衣建议
VLM 多模态交互 Demo:上传图片后由端侧视觉语言模型识别并由数字人播报

实时口型与音画同步

Digital Man Demo 接收大模型生成的文本后,实时完成语音合成、数字人口型生成以及音视频同步输出。当前数字人输出规格如下:

项目 规格
数字人画面 720 × 940,RGB888
视频帧率 20 FPS
原始语音 16 kHz、16 bit、单声道
显示输出 HDMI 或 DSI,双连接时优先 HDMI
文本通信 Unix Domain Socket 流式传输

数字人画面通过 Rockit VO 硬件图层输出,充分利用平台多媒体能力;语音数据则通过 Rockit AO 输出,并可根据实际声卡能力进行采样率适配。

Web 端灵活配置与多模态交互

Web Demo 不仅提供直观的聊天界面,还支持模型管理、LLM/VLM 模型切换、图片上传、流式回答和数字人联动控制。部署兼容的 VLM 模型后,用户可直接从页面选择图片,输入「请描述图片内容」「图片中的人在做什么」等问题,由设备侧完成视觉理解与回答生成,再由数字人进行自然播报。

通过环境变量配置 SYSTEM_PROMPT,还可以快速定义数字人的身份、品牌背景和服务风格。例如,可将数字人设定为设备品牌技术顾问:

你是本设备的官方数字人,为用户提供专业、热情、通俗易懂的技术咨询与服务。请将复杂技术转化为用户可感知的价值,并尽量使用适合语音播报的自然表达。

同一套技术底座可以根据场景快速切换为产品讲解员、企业前台、展厅导览员、智能客服或行业知识助手。

可落地的应用场景

应用场景 价值要点
展厅与企业讲解 数字人可以持续介绍企业、产品和解决方案,并根据访客提问实时生成个性化回答,让传统展板升级为可交流的智能讲解员
产品咨询与技术支持 7×24 响应客户咨询,结合本地知识库提供专业、准确的技术问答
政务、医疗与公共服务 本地推理保障数据隐私,符合行业合规要求,可部署在医院、政务大厅、社区服务中心等场景
智能座舱与机器人 为车载终端、服务机器人提供端侧多模态交互能力,无网络依赖、低延迟
教育与知识传播 将教材内容接入数字人,实现个性化讲解、知识问答与课堂互动

下一步:从键盘问答走向自然对话

当前已经完成

已完成能力 说明
Web 页面与 RKLLM3 本地大模型联调 实现浏览器端到本地推理服务的端到端调用
LLM / VLM 模型切换 Web 页面支持在已部署的 LLM 与 VLM 模型之间动态切换
VLM 图片识别 支持上传图片并调用 VLM 进行图片识别与内容分析
流式回答输出 大模型回答以流式方式输出,数字人同步组织播报
Digital Man 服务联动 Web Demo 与 Digital Man 服务无缝集成
数字人实时合成 实时生成语音、口型与数字人画面
当前播报打断 基于新会话标识的内容切换与打断
实机输出验证 HDMI 显示和声卡输出实机验证,代码同时支持 DSI 横屏显示
System Prompt 可配置 Web Demo 支持通过环境变量配置数字人身份与服务风格

后续计划扩展

扩展方向 说明
接入 ASR 接入麦克风和 ASR,实现直接语音提问
企业知识库 接入企业知识库,增强专业领域回答能力
并行 ASR 模型 利用空闲 RK1828 模块部署独立 ASR 等模型
多模型并行 将不同模型分配到不同协处理模块,实现更多 AI 任务并行
业务系统对接 对接业务系统、智能家居或机器人控制接口
多形象多音色 增加多角色、多音色及更多数字人形象

实时演示:端侧大模型 × 数字人交互

下面这段视频展示了 AIBOX PRO 在本地同时运行大模型推理与数字人合成时的实际效果:

AIBOX PRO 端侧大模型 × 实时数字人 Demo

最终交互链路将进一步升级为:

阶段 处理模块 关键动作
用户说话 麦克风 语音输入
ASR 语音识别 RK1828 模块 B 将语音转为文字
大模型理解与生成 RK1828 模块 A 调用本地 LLM/VLM 生成回答
数字人实时播报 Core-3588JD4 Digital Man 合成语音、口型与画面
业务系统或设备执行 对接系统 触发业务系统或智能家居设备响应

让端侧 AI 拥有更自然的表达方式

Web 大模型与 Digital Man Demo 的成功联动,验证了 AIBOX PRO 承载端侧大模型推理、数字人音视频生成以及异构模块协同的可行性,为进一步构建完整语音交互系统提供了基础。

依托 Core-3588JD4 与 RK1828 的异构分工,AIBOX PRO 还可以继续向语音识别、多路视频分析、智能设备控制等方向扩展,并通过更换模块来支持更多样化的模型需求。未来,我们将继续围绕端侧大模型、数字人、多模态感知与行业应用进行探索,让一个盒子承载更多个性化 AI 能力,也让每一次人机交互更加简单、智能和有温度。

让科技更简单 · 让生活更智能

微信公众号
关注我们了解更多