美团正式发布大模型 LongCat-Flash-Chat(中文名龙猫),并在 GitHub、Hugging Face 平台开源,同时同步上线官网 longcat.ai。
LongCat-Flash 采用创新性混合专家模型(MoE)架构,总参数 560B,激活参数 18.6B~31.3B(平均 27B),实现了计算效率与性能的双重优化。作为一款非思考型基础模型,它在仅激活少量参数的前提下,性能比肩当下领先的主流模型,尤其在智能体任务中具备突出优势。
架构层面引入「零计算专家(Zero-Computation Experts)」机制,每个 token 依据上下文需求仅激活 18.6B~31.3B 参数,实现算力按需分配;训练过程采用 PID 控制器实时微调专家偏置,将单 token 平均激活量稳定在约 27B。层间还铺设跨层通道,使 MoE 的通信和计算能很大程度上并行。
性能上:MMLU 89.71、CEval 90.44,ArenaHard-V2 得 86.50 位列第二;智能体工具使用方面,τ2-Bench 表现超越参数规模更大的模型,VitaBench 以 24.30 位列第一;编程方面 TerminalBench 39.51 位列第二、SWE-Bench-Verified 60.4;指令遵循方面 IFEval 89.65 位列第一。
推理效率是主打:在 H800 上达成单用户 100+ tokens/s 的生成速度,输出成本低至 5 元/百万 token。同步提供基于 SGLang 和 vLLM 的两种部署方案,开源仓库统一采用 MIT License,并允许用户利用模型输出、通过蒸馏等方式训练其他模型。