01
Deltafin 在 Apple Silicon MacBook Pro 上通过四块 SSD 流式传输,实现了未经裁剪的 2.8 万亿参数 Kimi K3 模型局部运行,达到了约 1 token/s 的生成速度。该做法保留全部 16 路专家并由模型自身对每个 token 进行校验,避免任何质量损失来换取速度。通过将模型分块存储并在需要时调用,Deltafin 展示了在消费级硬件上推理超大规模模型的可行性,同时也凸显了存储带宽与缓存命中率成为性能瓶颈的矛盾。此进展意味着希望在个人工作站上进行前沿模型实验的开发者,可在不降低输出质量的前提下,以更低的硬件门槛获得可用的生成速度。








