×

支持多卡级联推理的 RK1828 边缘 AI 本地部署方案:RK3588 主控 + RK1828 NPU 加速卡,单卡 7B / 双卡 12B / 四卡 27B

2026-09-10





支持多卡级联推理的 RK1828 边缘 AI 本地部署方案:RK3588 主控 + RK1828 NPU 加速卡,单卡 7B / 双卡 12B / 四卡 27B



当 AI 从云端走向设备现场,单块端侧 NPU 的算力与内存都十分有限。爱派派 基于 RK3588 主控 + RK1828 NPU 加速卡 的多卡级联架构,将多块 NPU 的算力与内存统一调度、协同推理,让大参数模型、视觉理解、语音处理与 Agent 工具能力部署到本地设备——从单卡 7B 轻量推理、双卡 12B,再到四卡 27B 推理的灵活扩展。

RK1828 多卡级联边缘 AI 本地部署方案封面

一、方案总览

方案采用 RKNN3 / RKLLM3 推理软件栈,兼容网页交互和 OpenAI API,可接入 OpenCode 等代码 Agent 工具。模型权重、输入数据、推理过程和输出结果均可在本地完成,为边缘 AI 应用提供可控、可扩展的基础平台。

维度 方案要点
主控 + 加速 RK3588 主控 + RK1828 NPU 加速卡(多卡 PCIe 级联)
推理软件栈 RKNN3 / RKLLM3
应用接入 网页 Web UI + OpenAI 兼容 API + Python OpenAI SDK
工具生态 OpenCode 代码 Agent、MCP、企业内部 HTTP API
模型规模 单卡 7B / 双卡 12B / 四卡 27B
硬件载体 爱派派 AIBOX PRO(RK3588 + M.2 外挂 RK1828,当前双卡)

二、多卡级联运行大参数模型

针对单卡难以容纳的大参数模型,RK1828 支持将模型拆分为多个 segment,并通过 PCIe 连接多张加速卡完成级联推理。以 Qwen3.8-27B 为例,四卡级联时四个模型 segment 分别加载到四张 RK1828 卡上,由主控侧 pipeline 组织 prefill 与 decode 阶段的数据传递——在保持模型完整性的同时,实现大参数模型在边缘设备上的本地部署:

Qwen3.8-27B
        -> segment 0 -> RK1828 card 0
        -> segment 1 -> RK1828 card 1
        -> segment 2 -> RK1828 card 2
        -> segment 3 -> RK1828 card 3
加速卡数量 可部署模型规模 说明
单卡 7B 轻量推理
双卡 12B
四卡 27B Qwen3.8-27B 分段加载到 4 张 RK1828

三、统一的应用接入方式

部署完成后,应用可以通过统一入口接入本地模型:

接入方式 典型用途
浏览器访问本地 Web UI 可视化对话
OpenAI 兼容接口 接入已有业务系统
Python OpenAI SDK 脚本/服务调用本地模型
OpenCode 代码 Agent 代码分析、文件修改、工程验证
Agent 工具链 扩展文件 / Shell / MCP / 企业内部 API 能力

四、方案核心优势

优势 说明
本地运行,降低长期调用成本 模型运行在 RK1828 本地 NPU 上,日常推理不依赖云端 token 计费;高频问答、代码辅助、文档处理、会议总结与持续在线的边缘任务,可按设备部署规模规划硬件成本,减少对远程 API 调用费用的依赖。
数据留在本地 本地推理链路可将代码、文档、图片、视频与会议内容保留在设备或企业内网中;代码分析、会议转写、总结与语义检索在本地完成,模型日志、会话记录与业务结果可使用本地策略管理。
模型和部署规模灵活切换 以模型目录和 OpenAI 兼容接口为基础进行模型切换;根据模型规模与应用类型,可配置单卡、双卡或四卡推理。
支持 Agent 与开发工具 连接文件读工具、Shell 与编译工具、本地代码仓库、MCP 服务、文档解析与知识库;调用企业内部 HTTP API,配合 OpenCode 代码 Agent 完成编码任务。

五、性能测试说明

官方给出的性能测试数据来自 Firefly RK3588 与 RK1828 NPU 加速卡,主要用于展示已验证的本地推理能力。测试时 RK1828 与 RK3588 均启用性能模式,VLM 的 Vision 与 LLM 耗时均为独立测试,详细测试条件请参考 SDK 中的文档。具体基准数值以 Firefly 官方 SDK 文档为准。

六、AIBOX PRO 提供可靠硬件支持

爱派派 AIBOX PRO 以 RK3588 作为系统、编解码与 IO 主控,通过 M.2 接口外挂 RK1828 NPU 加速卡,扩展大模型算力(当前支持双卡),为大模型运行提供可靠的硬件支持。

AIBOX PRO 后视 I/O 接口
AIBOX PRO 尺寸图 148×106×36.4mm
AIBOX PRO 侧视 I/O 接口

能力 AIBOX PRO 现状 / 规划
主控 RK3588(系统 / 编解码 / IO 主控)
NPU 扩展 M.2 外挂 RK1828 NPU 加速卡,当前双卡
推理栈 支持 RKNN3 / RKLLM3 本地推理
多模态 可运行 Gemma4 12B 多模态模型的双卡分段推理
视觉语言 可运行 Qwen3-VL,完成图像理解、视频分析
后续规划 将支持 4 卡级联版型

七、获取体验与结语

感兴趣的朋友请联系业务获取体验名额,后续将支持对 4 卡级联版型。

让科技更简单
让生活更智能