Daily Technical Tracking

每周科技追踪 · 2026-9-28

2026年9月28日(周一) · 技术 / 产品 / 公司

每日追踪
← 返回首页

DeepSeek 首公开V4.1训练底座

DeepSeek 与清华大学联合发布技术报告,首次公开支撑 V3.2 到 V4.1 训练的沙箱基础设施 DSec。这套自研的生产级弹性计算平台承担智能体大规模训练与评测的安全运行环境:一个生产单元由约 160 个 CPU 节点、3 万个 CPU 核心和 250TB 内存构成,托管 PB 级镜像;单日可服务约 300 万个沙盒,峰值并发超过 38 万个,创建速度超过每秒 5000 个,单个训练任务最多一次拉起 3.2 万个沙盒。

智能体强化学习与传统训练的差别在于模型要真正操作一台计算机:检索代码仓库、配置依赖环境、修改代码逻辑、在终端执行测试、按报错继续调试。单次 Rollout 里成千上万个智能体同时探索,要求系统瞬间交付数万台彼此隔离、有状态且高度连贯的执行环境——第十步执行的命令,必须严格建立在前九步改过的文件、编译好的二进制和运行中的服务之上。以 Kubernetes 为代表的无状态容器编排在瞬态脉冲并发、海量异构与极低镜像复用、长程驻留算力潮汐三个方向同时错配。

平台放弃“万能沙箱”的设想,把环境切成四类:面向短时无状态任务、基于常驻预热池运行的 FnCall;单机可部署 3200 个实例、承载软件工程与工具交互的标准容器;基于 Firecracker 构建独立内核、提供硬件级隔离的 MicroVM;以及接入虚拟化 GPU 驱动、支持完整商用操作系统与 Android 模拟器的全功能虚拟机。环境不追求统一,统一的是接入接口——上层通过统一的 Python SDK 声明任务所需的计算类型与资源上限,由调度系统自动路由到合适的载体。

高倍率超卖靠内核层三项收口落地:MicroVM 用 Virtio-pmem 配合 DAX 把只读磁盘内容直接映射为宿主机内存,宿主机峰值内存下降 40.2%;可写磁盘借 Linux DAMON 定期采样内存活跃度主动淘汰冷页,长程内存消耗再降 21.2%;对时延敏感任务启用内核核心调度,禁止低优先级任务占用同一物理核心的孪生超线程,高负载下长尾延迟涨幅从 45.2% 压到 17.3%。存储侧把镜像拆成基础系统、任务代码区与工具链三层不可变层,按需流式加载,磁盘写入减少 57%、任务耗时缩短超过 40%;驱动多轮交互的 Agent Loop 也从易失性 GPU 集群迁出,算力被抢占时沙箱就地休眠释放内存,算力恢复后原位透明唤醒。