边缘 AI 大模型一体机 AIBOX PRO 成功跑通 Web 大模型调用、VLM 图片识别与 Digital Man 实时数字人,完成从文字或图片输入、端侧模型推理,到数字人语音播报和画面呈现的完整链路验证。
Web Demo 支持在 LLM 与 VLM 模型之间切换:既能进行文字问答,也能上传图片并围绕图片内容提问。这不只是多个应用的简单组合,更直观展现了 AIBOX PRO 异构架构的价值:大模型推理与音视频处理由不同计算模块承担,各自独立运行、并行协作,在一个盒子内完成从「感知、思考」到「表达」的全过程。

AIBOX PRO 采用双核心板模组与异构计算设计,不同核心模组可以独立工作,并根据任务特点进行分工:

在本次数字人 Demo 中,任务分工如下:大模型推理与数字人音视频链路互不挤占同一处理模块——RK1828 负责生成回答,Core-3588JD4 负责将回答转化为可见、可听的数字人内容。另一个尚未投入本 Demo 的 RK1828 模块,为后续增加 ASR、多路视频分析或其他并行模型保留了扩展空间。
整套方案采用模块化设计,各环节通过标准接口协同工作:
| 环节 | 处理模块 | 关键能力 |
|---|---|---|
| 输入 | Core-3588JD4 | Web 页面接收文字或图片 |
| 模型选择 | Web 前端 | 在 LLM / VLM 之间动态切换 |
| 大模型推理 | RK1828 模块 A | 调用 RKLLM3 本地大模型 Server |
| 结果生成 | RK1828 模块 A | LLM 完成文字问答 / VLM 理解图片并生成回答 |
| 数字人合成 | Core-3588JD4 | Digital Man 接收回答,按句生成语音、口型、画面 |
| 输出呈现 | Core-3588JD4 | Rockit VO/AO 输出 HDMI 画面与音频 |

与传统「云端请求—等待结果—播放固定内容」的方案不同,当前 Demo 支持大模型回答的流式处理:模型一边生成内容,数字人一边组织播报,在降低等待感的同时,让交互过程更加自然。
Web Demo 通过 OpenAI 兼容接口调用设备上的 RKLLM3 Server,并支持在页面中切换已部署的 LLM 与 VLM 模型。使用 LLM 时,系统完成常规文字问答;切换至 VLM 后,用户可上传图片并提出问题,图片与文本将一并发送给本地推理服务,由视觉语言模型完成图片内容理解并生成回答。Digital Man 服务继续接收模型输出,将文字回答转化为同步的语音、口型和数字人画面。
在采用本地模型且不调用外部服务时,用户问题和模型推理数据可以保留在设备侧。端侧异构部署带来以下六大核心价值:
| 核心亮点 | 价值说明 |
|---|---|
| 减少网络等待 | 模型部署在本地,减少云端网络往返和网络波动带来的额外等待 |
| 数据更可控 | 可根据项目要求在本地完成问题处理和模型推理,无信息泄露风险 |
| 部署更灵活 | 适合展厅、前台、园区、门店及其他边缘场景 |
| 交互形式丰富 | 同一 Web 入口支持文字问答、模型切换和图片识别,无需额外切换 |
| 任务可并行 | 大模型与数字人音视频任务可由不同计算模块独立承担 |
| 扩展空间充足 | 当前仍有一个 RK1828 模块未被本 Demo 占用,可继续部署其他 AI 能力 |

Digital Man Demo 接收大模型生成的文本后,实时完成语音合成、数字人口型生成以及音视频同步输出。当前数字人输出规格如下:
| 项目 | 规格 |
|---|---|
| 数字人画面 | 720 × 940,RGB888 |
| 视频帧率 | 20 FPS |
| 原始语音 | 16 kHz、16 bit、单声道 |
| 显示输出 | HDMI 或 DSI,双连接时优先 HDMI |
| 文本通信 | Unix Domain Socket 流式传输 |
数字人画面通过 Rockit VO 硬件图层输出,充分利用平台多媒体能力;语音数据则通过 Rockit AO 输出,并可根据实际声卡能力进行采样率适配。
Web Demo 不仅提供直观的聊天界面,还支持模型管理、LLM/VLM 模型切换、图片上传、流式回答和数字人联动控制。部署兼容的 VLM 模型后,用户可直接从页面选择图片,输入「请描述图片内容」「图片中的人在做什么」等问题,由设备侧完成视觉理解与回答生成,再由数字人进行自然播报。
通过环境变量配置 SYSTEM_PROMPT,还可以快速定义数字人的身份、品牌背景和服务风格。例如,可将数字人设定为设备品牌技术顾问:
你是本设备的官方数字人,为用户提供专业、热情、通俗易懂的技术咨询与服务。请将复杂技术转化为用户可感知的价值,并尽量使用适合语音播报的自然表达。
同一套技术底座可以根据场景快速切换为产品讲解员、企业前台、展厅导览员、智能客服或行业知识助手。
| 应用场景 | 价值要点 |
|---|---|
| 展厅与企业讲解 | 数字人可以持续介绍企业、产品和解决方案,并根据访客提问实时生成个性化回答,让传统展板升级为可交流的智能讲解员 |
| 产品咨询与技术支持 | 7×24 响应客户咨询,结合本地知识库提供专业、准确的技术问答 |
| 政务、医疗与公共服务 | 本地推理保障数据隐私,符合行业合规要求,可部署在医院、政务大厅、社区服务中心等场景 |
| 智能座舱与机器人 | 为车载终端、服务机器人提供端侧多模态交互能力,无网络依赖、低延迟 |
| 教育与知识传播 | 将教材内容接入数字人,实现个性化讲解、知识问答与课堂互动 |
| 已完成能力 | 说明 |
|---|---|
| Web 页面与 RKLLM3 本地大模型联调 | 实现浏览器端到本地推理服务的端到端调用 |
| LLM / VLM 模型切换 | Web 页面支持在已部署的 LLM 与 VLM 模型之间动态切换 |
| VLM 图片识别 | 支持上传图片并调用 VLM 进行图片识别与内容分析 |
| 流式回答输出 | 大模型回答以流式方式输出,数字人同步组织播报 |
| Digital Man 服务联动 | Web Demo 与 Digital Man 服务无缝集成 |
| 数字人实时合成 | 实时生成语音、口型与数字人画面 |
| 当前播报打断 | 基于新会话标识的内容切换与打断 |
| 实机输出验证 | HDMI 显示和声卡输出实机验证,代码同时支持 DSI 横屏显示 |
| System Prompt 可配置 | Web Demo 支持通过环境变量配置数字人身份与服务风格 |
| 扩展方向 | 说明 |
|---|---|
| 接入 ASR | 接入麦克风和 ASR,实现直接语音提问 |
| 企业知识库 | 接入企业知识库,增强专业领域回答能力 |
| 并行 ASR 模型 | 利用空闲 RK1828 模块部署独立 ASR 等模型 |
| 多模型并行 | 将不同模型分配到不同协处理模块,实现更多 AI 任务并行 |
| 业务系统对接 | 对接业务系统、智能家居或机器人控制接口 |
| 多形象多音色 | 增加多角色、多音色及更多数字人形象 |
下面这段视频展示了 AIBOX PRO 在本地同时运行大模型推理与数字人合成时的实际效果:
最终交互链路将进一步升级为:
| 阶段 | 处理模块 | 关键动作 |
|---|---|---|
| 用户说话 | 麦克风 | 语音输入 |
| ASR 语音识别 | RK1828 模块 B | 将语音转为文字 |
| 大模型理解与生成 | RK1828 模块 A | 调用本地 LLM/VLM 生成回答 |
| 数字人实时播报 | Core-3588JD4 | Digital Man 合成语音、口型与画面 |
| 业务系统或设备执行 | 对接系统 | 触发业务系统或智能家居设备响应 |
Web 大模型与 Digital Man Demo 的成功联动,验证了 AIBOX PRO 承载端侧大模型推理、数字人音视频生成以及异构模块协同的可行性,为进一步构建完整语音交互系统提供了基础。
依托 Core-3588JD4 与 RK1828 的异构分工,AIBOX PRO 还可以继续向语音识别、多路视频分析、智能设备控制等方向扩展,并通过更换模块来支持更多样化的模型需求。未来,我们将继续围绕端侧大模型、数字人、多模态感知与行业应用进行探索,让一个盒子承载更多个性化 AI 能力,也让每一次人机交互更加简单、智能和有温度。
让科技更简单 · 让生活更智能
