
2026 年 8 月 14 日 Qwen3.8-27B 开源当天,瑞芯微宣布 RK1828 协处理器多卡级联跑通该模型,官方实测 13 TPS。但端侧跑 27B 本身已不新鲜,真正值得看的,是 RK1828 是一张 M.2/SO-DIMM 形态的 PCIe 插卡,能直接插进已经部署在车间、车里、机房里的 RK3588 整机。而把这张牌真正”打实”的,是一台预留了双路算力卡扩展位的整机——爱派派 AIBOX PRO KIT(RK3588 主模组 + 2×RK1828 副模组)。
—
2026 年 8 月 14 日,阿里通义千问开源 Qwen3.8-27B——270 亿参数、原生多模态、26.2 万上下文、Apache-2.0。同一天瑞芯微宣布,自家端侧协处理器 RK1828 通过多卡级联跑通了它,官方实测 13 TPS,管这叫”Day0 适配”。
大多数报道会把焦点放在”端侧又跑通一个大模型”上。这个焦点是错的。能跑 27B 早就不是新闻了:一个月前的 7 月 14 日,PrismML 的 Bonsai 27B 把 Qwen3.6-27B 压到 1-bit、3.9GB,在 iPhone 17 Pro 上端侧运行;NVIDIA Jetson AGX Orin 64GB 能跑 Qwen 2.5 32B、Llama 3.1 70B;消费级显卡 4-bit 跑 27B 更是去年就有的事。13 TPS 这个速度本身也谈不上亮眼,甚至偏慢。
真正值得看的,是 RK1828 长什么样、能插进谁已经在运转的机器里。
它不是一颗焊在新板子上的芯片,而是一张标准 M.2 Key M 形态的 PCIe 插卡。创龙、正点原子等嵌入式模组厂已经在卖对应的算力卡和评估套件,接口走 PCIe,典型功耗约 5W、配个散热片就能用。以爱派派 AIBOX PRO KIT 为例,设备主板预留 2 路 M.2 M-KEY 扩展位,选配 2×RK1828 算力卡可新增 40 TOPS 独立 NPU 与 10GB 高带宽片内 DRAM,存量整机无需改版,低成本完成算力扩容。
这才是这局的关键。要理解它为什么重要,得先从一堵墙讲起。
—
判断端侧能不能跑大模型,盯着 TOPS 算力看是看错了地方。
打个建筑的比方。TOPS 是施工队人数,人多盖得快;但大模型推理的瓶颈不在工人多少,而在材料能不能及时运到工地。模型权重就是建材,每生成一个 token,几乎要把整栋楼的材料从仓库搬一遍。仓库到工地的路宽,就是内存带宽。
路就那么宽,派再多工人也没用,全堵路上。这就是业内讲了多年的”内存墙”。算力可以堆,带宽堆不动。
RK1828 的解法,是把仓库直接盖在工地底下。它是一颗端侧 AI 协处理器(AI Coprocessor,专门做大模型推理、挂在主芯片旁帮忙的加速芯片),单卡标称 20 TOPS(INT8),重点是约 5GB 的片内 3D 堆叠 DRAM——内存和计算芯片垂直叠封在一起,带宽比电路板上挂的普通 LPDDR 高出一个量级。主控 SoC(比如 RK3588)通过 PCIe 调用它。
据瑞芯微官网,单颗 RK1828 跑 Qwen3-8B 约 61 TPS,跑 Qwen2.5-7B 首帧约 160 毫秒、50+ TPS。这是单卡舒适区,7B 到 8B。
注意这个上限。单卡 5GB 片内内存,4-bit 量化后跑 8B 就到顶了。Qwen3.8-27B 用 4-bit 压缩,权重要占 13GB 以上,再加 KV cache,单卡塞不下。
—
多塞几张卡。瑞芯微叫它”多卡级联”:一台设备插多张 RK1828,PCIe 互联,协同跑一个模型。主控调度,模型切开分摊到各卡的片内内存里。
边界必须说清楚:多卡级联主要扩张内存容量,不是吞吐量。 它解决”27B 装不装得下”,不解决”比单卡快几倍”。卡数翻倍速度不会翻倍——别被”级联”带出”算力叠加”的联想。数据摆在那儿:单卡 Qwen3-8B 约 61 TPS;多卡跑参数大三倍多的 Qwen3.8-27B,只有 13 TPS。两组测试的模型架构、量化方式和运行条件并不相同,不能直接拿来计算跨卡损耗;但至少看不出多卡带来了吞吐量上的线性增益。
代价从哪来?模型一切开,每个 token 的中间结果都得在卡间传输。片内超高带宽只在单卡内部成立;一跨卡就走 PCIe(RK1828 走的是 PCIe 2.1),从片内的数百 GB/s 掉到个位数 GB/s,差一两个数量级。
这就引出一个反推:跨卡要付出掉速和复杂度的代价,瑞芯微还是选择用级联来跑 27B,而不是把单卡内存做大——一个合理的推测是:现阶段这颗 3D 堆叠方案的单片容量,确实就顶在 5GB 这个量级。既然单卡装不下 27B,又想守住端侧推理这条路,多卡拼容量几乎是唯一的工程选择。
—
RK3588 是瑞芯微 2022 年推出的旗舰应用处理器,8nm、4×A76+4×A55 八核、自带 6 TOPS NPU。过去三四年,它已经成为国内中高端 ARM 边缘设备常见的”公共底座”——Orange Pi 5、Radxa Rock 5、Banana Pi 等开发板采用它,工控机、边缘网关、NVR 录像机、智慧商显、机器人控制盒、车载 AI BOX、AI NAS 等产品也有大量方案。围绕 RK3588 的开发板、核心板、工业底板和软件工具链已经形成了相当成熟的生态。
但 RK3588 跑不动大模型,根子不在那 6 TOPS 算力,在内存。它配的是和 CPU、GPU、系统共享的 LPDDR,带宽只有几十 GB/s,还得分给操作系统、显示、视频编解码和各种任务。而大模型解码阶段是带宽密集型活,算力再多也得等权重数据从内存搬过来——这正是前面那堵内存墙。
RK1828 解决的恰恰是这个,不是”再给你 20 TOPS 算力”那么简单。它真正带过来的,是那 5GB 独立的高带宽片内 3D 堆叠 DRAM——这个内存池专供大模型,不跟系统抢。20 TOPS 的 NPU 是和这片内存配套的算力,真正稀缺的是那片高带宽内存。
一个旁证:当前这颗方案单芯片的片内内存上限就是 5GB。同系列还有颗 RK1820,NPU 同样是 20 TOPS,封装完全一样,唯一区别是片内 DRAM 只有 2.5GB,定位 3B 级模型;RK1828 把这片内存翻到 5GB,才够放下 4-bit 的 7B。这条产品线分档分的从来不是算力,是内存容量——3D 堆叠里 DRAM 叠在 NPU 正上方,投影面积被 NPU die 的尺寸框住,能叠几层又受热阻、良率、成本和封装厚度一起牵制。
它的逻辑因此清晰了:不是”我做颗更强的新芯片,你重新设计整机”,而是”你那台已经在机房、车间、车里转着的 RK3588,只要主板上有空闲的 M.2 Key M 槽,插一张我的卡,就等于外挂一个专用高带宽内存池,单卡能跑到 7B–8B,多卡级联还能往 27B 撑”。
—


RK1828 的价值要落地,前提是一台真正预留了双路扩展槽、能即插即用、工业级可靠的 RK3588 整机。这正是爱派派 AIBOX PRO KIT 的设计原点。
双核异构,模型并行多任务协作。 采用主模组与副模组异构分体式架构,通过 PCIe 接口高速互联:主模组(RK3588,Core-3588JD4)统筹任务调度与数据预处理,集成 6 TOPS NPU 与 8K 级 VPU——支持 8K@30fps 编码、8K@60fps 解码,可多通道 4K 视频流并行处理;副模组(2×RK1828)专注 AI 推理核心算力输出,提供 40 TOPS 独立 NPU 与 10GB 高带宽片内 DRAM,可流畅运行 7B 以内大模型,多卡并联向 27B 级扩展。存算一体式设计大幅提高 DRAM 带宽,提升大模型推理的 TPS 与首帧延时表现。
边缘计算低延迟,数据不出设备。 本地 AI 处理减少网络依赖,所有业务数据本地存储、本地运算,不受网速波动影响,实现毫秒级响应与数据隐私保护,满足数据安全法规与行业隐私合规要求。
工业级接口与扩展。 双路千兆以太网、USB3.0×2、USB2.0×2、HDMI2.1(4K@60Hz)、M.2 E/B/M-KEY、Mini PCIe、RS485、CAN-FD、光耦隔离 DI/DO、SATA3.0、TF Card、SIM Card、Type-C 等一应俱全;板载 SATA3.0 与 M.2 PCIe 高速接口,存储可拓展至 TB 级。尺寸仅 148.0 × 106.0 × 36.4 mm,工作温度 -20℃~60℃,DC 12V 宽电压(9V~36V)输入,典型功耗 15.6W(RK3588 + 2×RK1828),最大 42W。
广泛的应用场景。 机器人、AI 边缘计算、工业自动化、智能安防、智能驾驶、交通管理、智慧城市、家庭存储、零售自动化等。提供配套源代码、实操教程、详细技术文档与开发工具,助力二次开发。
—
两句话得放这儿。
第一,13 TPS 目前只有厂商一个信源。 中英文媒体和开发者社区里,除了瑞芯微自己的公众号,没有第三方评测或复现。量化精度、测试环境、卡数全没披露。它能当”官方宣布的能力”,不能当”已被验证的事实”。
第二,13 TPS 客观上偏慢。 Qwen3.8 主打编程和复杂多步任务,对低比特量化的精度损失更敏感。RK1828 定位本就不是拼速度,它适合的是数据不能出设备、网络不稳定、或者单次推理成本要算死的场景——工业检测、安防、机器人、车载、私有化部署。在这些地方,慢一点没关系,数据留得住、平台不用换才是第一位的。
所以这不是”端侧崛起、云端要完”的故事。端侧和云端各有各的位置,RK1828 做的,是给那些已经部署在现场、但受限于共享内存带宽的 RK3588 设备,一条外挂高带宽内存、插卡升级到大模型的路。
而 AIBOX PRO KIT,就是这条路上已经就绪的整机。 满地的 RK3588,配上双路 RK1828 算力卡,就是爱派派给边缘 AI 的一张实牌。
—
*如需 AIBOX PRO KIT 完整规格书、评估套件与 RK1828 算力卡选配方案,欢迎联系深圳市爱派派智能科技有限公司(天启智能)。*