2.4 Namespaces (PID/Net/Mount/UTS/IPC/User/Cgroup)

Linux namespace 把"全局唯一资源"切成多个互不可见的实例。CubeSandbox 用到的共有 7 类:

2026-07-04 · 2 min · 2622 字 · 风来

2.3 cgroups (资源限制)

cgroups(control groups)是 Linux 内核的资源计数与限制机制。把同一个 hierarchy 下的进程归到一个 cgroup,该 cgroup 的所有进程共享一套配额。典型可限制的资源:

2026-07-04 · 2 min · 2632 字 · 风来

2.2 Linux Capabilities(细粒度)

Linux 把传统 root 权限切成 40+ 个细粒度 capability(CAPCHOWN、CAPNETADMIN、CAPSYSADMIN 等)。每个进程同时持 5 个 capability set:

2026-07-04 · 1 min · 2132 字 · 风来

2.1 seccomp / seccomp-bpf (三层部署)

seccomp 是 Linux 内核的 syscall 过滤机制:

2026-07-04 · 2 min · 3721 字 · 风来

1.7 virtio Rate Limiter (TokenBucket)

TokenBucket (令牌桶) 是一种经典流量整形算法:

2026-07-04 · 2 min · 1760 字 · 风来

1.6 启动流程安全配置

Cloud-hypervisor 拉起一个 microVM 时,会把命令行参数(-append)注入到 guest kernel 的 cmdline。这些 cmdline 设置不是简单的版本号,而是一组对 guest kernel 行为的安

2026-07-04 · 1 min · 1944 字 · 风来

1.5 设备透传 (IOMMU / VFIO)

设备透传 (device passthrough) 把宿主机上的物理 PCI 设备(nic / disk)直接挂给某个 VM,VM 内能看到这块设备的真实 PCI BAR 与寄存器,而无需 hypervisor 的全设备模拟。

2026-07-04 · 2 min · 1921 字 · 风来

1.4 virtio 设备隔离

virtio 是虚拟机内最常见的"半虚拟化"IO 设备协议,CubeSandbox 中所有 guest ↔ host 数据通路(网络、磁盘、文件系统)都走 virtio。每个 virtio 设备的隔离由 3 个层面共同保证:

2026-07-04 · 1 min · 1648 字 · 风来

1.3 vCPU / 内存隔离

每个 sandbox 实例的 vCPU 数、内存大小、CPU 拓扑结构都通过 annotation cube.vmmres 显式声明,由 CubeShim 注入到 cloud-hypervisor 的 VM 配置里。三个核心要素:

2026-07-04 · 1 min · 1464 字 · 风来

1.2 独立 Guest Kernel(消除共享内核风险)

“独立 Guest Kernel” 指每个 sandbox 启动一台 microVM,VM 内运行的是专属的内核镜像(cube-guest-image-cpu.img),而不是像传统 Linux 容器那样 host kernel 通过 na

2026-07-04 · 1 min · 1661 字 · 风来