Karmabox Local AI Unit硬件方案 v2.8 · 初稿

机房内 AI 计算单元 · 数据不出本地

Karmabox Local AI Unit

本方案只定硬件 —— 设备、接口、连接方式、机柜、供电、管理通道。 服务怎么分布属于软件规划,后续可灵活调整,不影响硬件

4KarmaBox GB10AI 算力节点
2Agent Runtime二选一运行
2交换机高速 + 管理
1远程控制台IP-KVM · 机动使用
~1.0kW 日常功耗峰值约 1.5 kW
12U机柜600mm 深 · 用满 12U

为什么改软件不用动硬件

  • 4 台 GB10 同规格,能力相同,只是加载的模型不同
  • 6 台设备接入方式完全一致(高速网口 / 普通网口 / HDMI+USB / 电源)
  • 服务从一台挪到另一台,线不用重接,设备不用换

硬件侧唯一要盯的三件事

  • 高速铜缆型号 —— 规格接近但不通用,买错协商不上
  • 分支铜缆规格 —— 4 台全经分支线接入,弄错则线材作废
  • 机柜散热 —— 需按 Thermal 实测结果确定风扇方案

01调用链路

入口 → Agent Runtime → Site Gateway → GB10。Site Gateway 是软件服务,不绑定机器

入口

统一服务入口

使用者 / 业务系统

A1 或 A2 · 二选一

Agent Runtime

Agent 编排 / 工作流引擎 · 产物存储
监控告警 · 电源管理 · 备份同步 · 日志汇聚

软件服务 · 不绑定机器

Site Gateway

API 网关(鉴权 · 限流 · 审计)
模型路由与负载分发 · 异步任务队列

同规格 · 同层级

KarmaBox GB10 × 4

#01大模型对话配对
#02大模型对话配对
#03图片理解
文字识别
语音处理知识与数据
#04图片生成
视频生成

高速互联 —— 可 4 台联合跑超大模型

kb-gb10-03 额外承载知识与数据服务 —— 向量检索(RAG)· Memory 记忆 · 本体 Ontology · 业务数据库。 与图片理解 / OCR / 语音同机,知识写入和检索都在机内完成,不跨网。

02设备清单与基础功能

每台设备按黑盒对待 —— 只关心它露出来的接口。

C1–C4

KarmaBox GB10

kb-gb10-01 ~ 04

AI 算力节点 × 4 · 同规格

  • 大语言模型推理
  • 视觉语言理解
  • OCR 文字识别
  • 图像生成
  • 视频生成
  • 语音处理 ASR/TTS
  • 模型仓库与加载管理
  • OpenAI 兼容 API
  • 集群协作
  • 健康与指标上报
  • 通电自动开机
A1

Linux Agent Runtime

kb-agent-lx

Agent 运行平台 · 与 A2 二选一 · 降级运行

  • Agent 编排 / 工作流引擎
  • 产物存储
  • 监控与告警面板
  • 电源管理工具
  • 备份与冷备同步
  • 日志汇聚

⚠️ 型号待定 —— 按黑盒对待,需满足:arm64 · 2.5G 网口 · HDMI · USB · 可切电供电 · 可上机架
内存 / 存储按软件实际需要配置,不在硬件方案内约束

A2

macOS Agent Runtime

kb-agent-mac

Agent 运行平台 · 与 A1 二选一 · 完整运行

  • 同 A1 全部 6 项功能
  • A1 关闭:监控重组件、批处理

⚠️ 型号待定 —— 需满足:macOS · 网口可接管理面 · HDMI 可接控制台 · 可切电供电
内存 / 存储按软件实际需要配置,不在硬件方案内约束

所有设备只露出 4 类接口

设备高速网口普通网口HDMIUSB电源
KarmaBox GB10 × 4✓ 10G✓ 外置电源砖
Linux Agent Runtime✓ 2.5G
macOS Agent Runtime

03机柜立面 · 3D

拖动旋转 · 滚轮缩放 · 点击设备查看详情(会从机架滑出)· 点「展开」一次看全。
19" 机柜实测尺寸建模:面板 482.6mm · 深 600mm · 1U = 44.45mm。设备按各自实际尺寸 —— 最深的 UPS 350mm,故 600mm 深已够,不需要 800mm 深柜。

这只是堆叠示意,不是最终机柜设计图
  • 实际 U 位排布另行设计 —— 要结合线缆走向、维护通道、重量分布
  • GB10 高 50.5mm 超过 1U,故每 2 台占 1 个 2U 托盘;深度仅 150mm
  • 机柜深度按刚好容纳选 —— 最深设备(UPS)350mm,600mm 深柜已够,不必用 800mm 深的标准服务器柜
  • 远程控制台固定在侧壁,不占 U 位 —— 火柴盒大小(约 60×60×25mm);网线与供电固定,HDMI/USB 两根线按需插到目标机器
  • 风扇位以虚线/半透渲染 —— 表示尚未确定;散热方案需按 Thermal 实测结果定风扇数量、风量与布置
  • 点「风道」可看前进后出的气流示意 —— 只是设计意图,不代表实测风量
回路 A · 可远程断电 回路 B · 物理不可断 风扇位 · 待定

04统一管理:四条线

6 台设备只露出 4 类接口 —— 统一管理就是把这 4 类分别汇聚到 4 个集中点

设备侧接口

高速网口仅 4 台 GB10
普通网口6 台都有
HDMI + USB6 台都有
电源6 台都有

汇聚点

① 高速交换机

让 4 台 GB10 当一台用。还有富余端口,以后加第 5、6 台不用换交换机。

✗ 不做两两互连(硬件不支持) ✗ 不用光纤光模块(柜内铜缆够)

② 管理交换机

共 10 个口:4×GB10 + 2×Agent Runtime + 1×远程控制台 + 2×智能电源控制器 + 1 上行。

✓ 8 口 + 4 combo 完全够用,不需要级联

③ 远程控制台 × 1

网线与供电固定,HDMI/USB 两根线按需插到目标机器。平时常插 kb-gb10-03。

✓ 靠功率判定树才敢只配 1 个

④ 智能电源控制器

逐路开关 + 逐路功率计量。远程开机 / 关机 / 强制重启全靠它。

✓ GB10 没有 BMC、不支持网络唤醒,只能从电源侧解决

05组网图(端口级)

两个网段严格分离 —— 计算面只在 4 台 GB10 之间(L2、无网关);管理面接所有设备。

5.1 计算面 · 高速交换机端口分配

高速交换机CRS804-4DDQ-hRM · 半宽 1U
QSFP-DD 1分支 1→2GB10 #01 + #02
QSFP-DD 2分支 1→2GB10 #03 + #04
QSFP-DD 3可分支 2× 200G预留
QSFP-DD 4可分支 2× 200G预留
RJ45 × 210G可作管理上行
交换机端口分支为接到线材
QSFP-DD 12× 200GGB10 #01 + #02分支铜缆 × 1
QSFP-DD 22× 200GGB10 #03 + #04分支铜缆 × 1
QSFP-DD 32× 200G预留
QSFP-DD 42× 200G预留
RJ45 × 210G可作管理面上行
余量充足 —— 4 个 QSFP-DD 每个可分支成 2× 200G,共 8 个 200G 口只用了 4 个,加到 8 台 GB10 都不用换交换机。
线材统一 —— 4 台全走同一种分支铜缆,只需 2 根、1 种型号⚠️ 4 台都接在分支口上,速率必须一致 —— 这是验收项。

5.2 管理面 · 管理交换机端口分配

管理交换机MikroTik CRS312
P110GGB10 #01
P210GGB10 #02
P310GGB10 #03
P410GGB10 #04
P52.5GLinux Agent Runtime
P61G/10GmacOS Agent Runtime
P71G远程控制台
P81GShelly Pro 4PM
C1comboShelly Pro 2PM
C3 · C4combo预留
共用 10 个口,12 个可用 —— 不需要级联。 GB10 保 10G 是为了模型权重下载;混速接入没有问题,10GBase-T 向下兼容 1000BASE-T 是标准行为。

06对外接口清单(设备级)

每台设备露出来的物理接口,以及每个口接到哪。颜色对应四条线。

高速网口 普通网口 HDMI + USB(控制台) 电源 空置 / 预留

KarmaBox GB10

× 4
QSFP56
QSFP56空置
RJ45 10G
HDMI
USB-C × 4
电源输入
QSFP56(用 1 个)
→ 高速交换机
RJ45 10G
→ 管理交换机 P1–P4
HDMI + USB-C
→ 远程控制台(按需插拔)
电源输入(外置 240W 电源砖)
回路 A · Shelly Pro 4PM

第 2 个 QSFP56 口空置 —— 受硬件限制,插第二根线不会翻倍带宽。

Linux Agent Runtime

A1 · 型号待定
RJ45 2.5G
HDMI
USB
电源输入
RJ45 2.5G
→ 管理交换机 P5(不支持则回落 1G)
HDMI + USB
→ 远程控制台(按需)
电源输入
回路 A · Shelly Pro 2PM

macOS Agent Runtime

A2 · 型号待定
RJ45
HDMI
USB-C
电源输入
RJ45
→ 管理交换机 P6
HDMI + USB-C
→ 远程控制台(按需)
电源输入
回路 A · Shelly Pro 2PM

高速交换机

CRS804 · 半宽 1U
QSFP-DD 1已用
QSFP-DD 2已用
QSFP-DD 3预留
QSFP-DD 4预留
RJ45 10G × 2
双电源
QSFP-DD 1 · 2
各分支 2× 200G → 4 台 GB10
QSFP-DD 3 · 4
预留 —— 还可再接 4 台 200G 设备
电源输入
回路 B(物理不可远程断电)

管理交换机

× 1
10GBase-T × 8
combo × 4
电源输入
10GBase-T × 8 + combo × 4
见 §5.2 端口分配
电源输入
回路 B

智能电源控制器

4PM + 2PM
继电器输出 × 6
RJ45 × 2
WiFi
自身供电
继电器输出 × 6(4 + 2)
→ 6 台设备的电源(回路 A),逐路开关 + 功率计量
RJ45 × 2
→ 管理交换机 P8 / C1
WiFi
备用路径(可选)
自身供电
回路 B ⚠️ 关键

控制器自身必须接回路 B —— 否则市电波动时它自己先掉线,整套远程能力归零。

远程控制台(IP-KVM)

× 1
HDMI 输入
USB-C(HID)
RJ45
USB-C 供电
HDMI 输入 + USB-C(HID)
→ 目标机(按需插拔)
RJ45
→ 管理交换机 P7(固定)
USB-C 供电
回路 B ⚠️ 关键(固定)

供电绝不能从被管机器的 USB 上取 —— 否则切那台电时控制台跟着黑,恰好看不到开机过程。

07供电:两个回路

方案里最容易出事故的地方 —— 管理链路必须放在物理不可远程断电的回路。

7.1 电源管理架构

上半是电力路径,下半是控制与监测路径 —— 两者都汇到智能电源控制器。

市电进线220V
C 型断路器B 型会被涌流误跳
回路 A可远程控制
Shelly Pro 4PM4 路 · 开关 + 功率计量 Shelly Pro 2PM2 路 · 开关 + 功率计量
GB10 #01
GB10 #02
GB10 #03
GB10 #04
Linux Agent Runtime
macOS Agent Runtime
回路 B物理不可远程断电
普通插排无任何智能功能 小 UPS≥600VA · 专供本回路
高速交换机
管理交换机
远程控制台
Shelly 自身供电 ⚠️

物理上没有可控开关,就根本切不断 —— 比"软件里设置禁止操作"可靠得多。

控制与监测路径
运维本地 / VPN
管理交换机管理网段
Shelly 本地 APIHTTP · 不依赖云
继电器开关切 AC / 复电 → 设备通电自启
逐路功率读数喂给 §7.4 判定树

错峰上电必须实现 —— 4 路同时通电的涌流可能跳闸,而市电闪断自恢复时也会 4 路同时通电。 错峰逻辑建议放进控制器自己的本地脚本,人工触发和市电自恢复两种情况都能覆盖。

7.2 两个回路的成员

回路 A

可远程控制

智能电源控制器,逐路独立开关 + 功率计量

  • KarmaBox GB10 #01
  • KarmaBox GB10 #02
  • KarmaBox GB10 #03
  • KarmaBox GB10 #04
  • Linux Agent Runtime
  • macOS Agent Runtime
回路 B

物理不可远程断电

普通插排(无任何智能功能)+ 小 UPS 专供

  • 高速交换机
  • 管理交换机
  • 远程控制台
  • 智能电源控制器自身供电

软件锁定可能被误改或被攻破;物理上没有可控开关,就根本切不断。

7.3 配电箱与电气施工要求

断路器选 C 型脱扣曲线

开关电源上电涌流可达稳态十几倍,B 型容易被误跳

插拔网线必须断电

智能电源控制器厂商明确要求,不可带电插拔。

通道默认状态 = 恢复断电前

设"常断"→ 市电闪一下 6 台全趴着;设"常通"→ 会把故意关掉的机器拉起来。

市电闪断会 4 路同时通电

涌流跳闸风险,且发生在软件控制之外。错峰逻辑要放进控制器自己的本地脚本。

7.4 用电量当仪表盘 —— 这是只配 1 个远程控制台的前提

机器挂掉时它自己的监控也挂了,而 ping 不通分不清"机器死了"还是"网络断了"。功率读数可以。

连不上某台机器
≈ 0 W 已关机 / 掉电

→ 远程开机

≥ 40 W · 数值不动 真的卡死了

→ 切电重启

≥ 40 W · 数值波动 还在干活,只是网络断了

→ 千万别断电,用远程控制台进去查

最后一格是这个设计的价值 —— 它防止你把一台还在跑任务、只是网络出问题的机器强行断电。 光看能不能 ping 通是分不出来的,而这正是几乎每次误断电事故的原因。

GB10 功耗区间
≈ 0 W已断电
40–45 W开着但闲置
120–130 WCPU 满载
≈ 200 WGPU 满载

08硬件设备清单

⚠️ 本清单为初稿,型号与数量都需要继续讨论后再定
  • 下表主要说明"需要哪几类设备、各自解决什么问题",不作为采购依据
#项目数量说明
计算与网络
1KarmaBox GB104基于 NVIDIA DGX Spark(GB10)。同芯片 OEM 机型算力平台相同,可作备选
2高速交换机1MikroTik CRS804-4DDQ-hRM · 4× QSFP-DD(每口可分支 2× 200G)· 半宽 1U · 123W
3管理交换机1MikroTik CRS312(8 网口)
4高速分支铜缆2400G QSFP-DD → 2× 200G QSFP56。只需 1 种型号;规格极易买错,下单前需核对
5普通网线~12Cat6A
Agent Runtime
6Linux Agent Runtime1⚠️ 型号待定。按黑盒对待,满足接口契约即可(内存/存储按软件需要配)
7macOS Agent Runtime1⚠️ 型号待定。需满足 macOS + 接口契约(内存/存储按软件需要配)
管理与电源
8智能电源控制器(4 路)1Shelly Pro 4PM —— 每路独立开关且能读用电量
9智能电源控制器(2 路)1Shelly Pro 2PM
10配电箱 + C 型断路器 + 电工施工1 套断路器必须 C 型脱扣曲线;留存电气验收记录
11普通插排(回路 B)11U,不要任何智能功能
12远程控制台(IP-KVM)1JetKVM PoE 版GL.iNet Comet PoE(GL-RM1PE)。侧壁固定不占 U 位,机动使用,平时插在 kb-gb10-03。⚠️ 不要 ATX 电源控制板等配件
13USB-C 电源适配器 + 长 HDMI/USB 线各 1独立供电(接回路 B);线长需够到柜内任意一台
14GB10 机架托架2每个装 2 台
15小 UPS(必需)1只保回路 B,600VA 以上
16大 UPS(可选)1全套都保,需 2200VA 以上
17机柜112U · 深 600mm 级,前后通风。⚠️ 不需要 800mm 深的标准服务器柜 —— 最深设备(UPS)约 350mm
18理线与盲板按需

09待确认的硬件事项

需要落实型号 / 兼容性

  1. 分支铜缆型号 + 与 CRS804 的互通性规格接近但不通用,买错了协商不上
  2. 分支铜缆与 QSFP-DD 口互通性4 台全经分支线接入,只用 2 根同型号线;规格弄错则全部作废
  3. 管理交换机能否支持 2.5G支持更快,不支持回落 1G 也够用 —— 不是硬性要求
  4. 智能电源控制器型号 + 本地 API必须能脚本化,只有网页界面的不能用
  5. 两台 Agent Runtime 的具体型号Linux 侧与 macOS 侧均待定;选型不影响组网、机柜、供电设计

需要明确做法

  1. 依次上电(带时间间隔)怎么实现控制器本身不带,且市电闪断自恢复时也会 4 路同时通电
  2. 配电箱施工导轨器件安装、C 型断路器选型、接地、电气验收记录
  3. 机柜散热满负荷发热明显,必要时加装风扇组
  4. 6 台通电自动开机的实测记录能力已确认具备,但要逐台实测

软件侧待办另计 —— 服务部署方式、备份策略与频率、监控告警接入、远程接入配置、电源管理工具开发等。