在iPhone 16 Pro部署Kimi K3和 Deepseek V4

介绍我的新玩具 minirun, 使得一个 1.56 TB 的模型在 iPhone 上跑起来了。

Kimi K3,2.8 万亿参数的 MoE,权重 1.56 TB。现在能在 iPhone 16 Pro 上跑,内存预算 5.8 GB,权重从插在手机上的 NVMe 硬盘里按层流式读进来。非蒸馏版,非重新量化.

DeepSeek V4 Flash 0731(167 GB)在 iPhone 16 Pro生成速度17s/token, 内存占用稳定在 2G 以下。

Kimi K3 在 iPhone 16 Pro生成速度3min40s/token, 内存占用稳定在 5.8G。

硬盘盒和线比硬盘本身更重要。同一块盘,USB4 直连比走 10 Gb/s 的 hub 快 3 倍。手机上还得配供电底座,手机口带不动 NVMe。硬盘盒尽量选择40Gbps带内置风扇和散热鳍片的。10Gbps的盒子容易挂。

并且按照我的尝试,你自己部署最好搞一个强力手机散热器贴手机上,在跑kimi k3时手机还是需要强力散热的。

minirun 新增一种模型权重打包方式,支持MacOS和iOS 上的MLX,模型权重需要下载minirun格式的。

说说我的看法