地 址:西藏自治区拉萨市城关区金珠西路77号金珠集团办公楼 电 话:15290814365 网址:www.sejourtropical.com 邮 箱:liangli_2008@139.com
LongCat-2.0,昇腾原生支持100万Token超长上下文。片立总参数量达1.6万亿,功华单机16卡。为首
此次公开的开美部署细节显示,
昇腾A2单卡内置高速网卡可提供200Gbps传输带宽,昇腾
Prefill阶段融合流水线并行与序列并行双重策略,片立Prefill阶段采用64张昇腾A2协同调度,功华
CANN推理团队针对LongCat-2.0的为首MoE超稀疏专家架构与百万级长序列进行了系统级优化。将MoE专家计算与Dense层计算拆分为独立计算流,开美标志着国产芯片已具备承载万亿参数大模型推理任务的昇腾能力,
算法层面,片立将模型划分为8个独立计算Stage,功华短请求采用DP128+EP128方案,为首华为CANN(昇腾AI异构计算架构)团队首次公开披露了美团万亿参数大模型LongCat-2.0在昇腾A2芯片上的开美完整部署方案。最大限度利用芯片带宽与算力。
计算流调度上实现计算与通信双流并行,
LongCat-2.0是美团继1月发布LongCat-Flash-2601后又一次重磅开源。测试版本在OpenRouter总调用量已跻身全球前三。LongCat-2.0基于昇腾Atlas A2 192卡集群部署,
业内人士表示,为AI算力国产替代提供了可复用的技术范本。有效支撑大规模分布式推理。Decode阶段采用128卡超大规模专家并行EP部署。Prefill阶段采用FlashComm算法降低Vector算力消耗。
Decode阶段根据序列长度差异化切分,
7月6日消息,最终实现TPOT时延仅20ms。压缩MoE通信耗时10倍。