MTT SGX5000

MTT SGX5000

为大模型训练集群优化的服务器硬件系统

为大模型推理效率/性价比优化的服务器硬件系统

支持兼容主流软硬件生态的 GPU 服务器硬件系统

FP8 原生算力

万亿模型训练和推理的算力标准


在大模型参数持续扩张的趋势下,FP8 计算精度的支持已成为训练与推理前沿模型的核心精度标准。MTT SGX5000 率先实现硬件级原生 FP8 计算精度支持,在确保模型收敛的同时显著降低显存占用。针对大规模集群面临的带宽与算力瓶颈,MTT SGX5000 的 FP8 引擎全面支持 DeepSeek、Qwen 等前沿架构,训练性能提升超 30%,并大幅优化总体拥有成本。

面向万亿级参数大模型训练的万卡集群标杆


面对万亿参数大模型对算力规模与工程稳定性的极致挑战,MTT SGX5000 以前瞻性架构设计实现从单卡到万卡集群的线性性能跃升。在万卡级超大规模预训练实测中,MTT SGX5000 展现出卓越的精度一致性,训练效果与国际旗舰产品高度对齐。凭借突破性的算力利用率(MFU)表现,确保大规模训练任务的确定性交付与极致性能。

综合训练性能

综合训练性能

主流模型实测:在计算机视觉 (CV) 及大语言模型 (LLM) 核心训练场景中,综合性能达到国际旗舰产品 的 74%以上。

多模态微调超越:在多模态大模型微调任务中,实测性能表现优于国际旗舰产品
大规模集群高效率

大规模集群高效率

Llama3-70B 训练:模型算力利用率 (MFU) 突破 60%。
DeepSeek-236B 训练:模型算力利用率 (MFU) 超过 40%。
万卡集群高精度

万卡集群高精度

精度完全对齐:在 DeepSeek-236B 万卡集群训练中,在前 3 万步训练过程中,Loss 曲线与国际旗舰产品 集群的相对精度误差仅为 0.6%。

下游表现更优:在同等数据量下,下游任务评测得分优于国际旗舰产品,验证了万卡集群的高精度。
集群扩展

集群扩展

在超大规模 AI 模型训练中,我们实现了万卡级 GPU 集群训练线性度高达 95% 的重大突破。这意味着,当算力规模从千卡扩展至万卡时,训练任务的整体吞吐效率仍能保持近似线性增长。这一技术突破,在支持更大模型、更复杂任务的同时,也大幅缩短大模型的训练周期。
可靠、可用和可维护

可靠、可用和可维护

GPU 集群的可靠性、可用性和可维护性(RAS)是支撑大规模 AI 训练任务持续稳定运行的核心基础设施能力。

MTT SGX5000 从芯片级到系统级全面构建 RAS 体系,支持故障感知、上报与错误隔离,可快速定位并替换故障节点、慢节点及静默数据损坏节点;主动检测与修复,长期守护集群健康,确保性能稳定与结果正确。依托芯片级到系统级的 RAS 能力,MTT SGX5000 将万卡集群的训练成功率提升超 30%。
瞬时响应与极速交互

打造大模型推理的极致用户体验


MTT SGX5000 致力于打破算力与交互之间的屏障,通过软硬一体化深度协同,为 AI 应用提供近乎零延迟的响应体验。针对大语言模型推理场景,MTT SGX5000 进行了全栈式优化,通过集成 SGLang、vLLM 等高性能推理软件栈,充分发挥硬件架构在长序列处理与高频解码中的算力优势。

在长文本上下文理解任务中,MTT SGX5000 显著提升了预填充(Prefill)阶段效率,有效降低首 Token 延迟,确保复杂指令的即时响应。在内容生成阶段,通过深度优化解码(Decode)吞吐性能,实现了出众的文本输出速率。这一推理效能不仅满足用户对极速交互的需求,更在高并发访问场景下,为企业提供了更优的算力能效比与稳定的服务保障。

Prefill 性能飞跃

实现长文本瞬时首字响应

Prefill 性能飞跃
实现长文本瞬时首字响应

MTT SGX5000 深度优化了 Prefill 阶段的处理效率。在超长序列输入场景下,能够显著加速 Prompt 预处理过程,赋予国产算力更快的上下文理解与首 Token 响应速度,有效解决大规模知识库检索及长文档分析中的延迟瓶颈。

在 16k 长序列输入测试中,MTT SGX5000 单卡 Prefill 吞吐量是国际旗舰产品 的 2.5 倍。这意味着在处理长文本 Prompt 时,国产算力具备更快的上下文理解速度。

以极速交互表现赋能智能体与 AI 编程


在智能体交互(Agentic AI)与 AI 编程辅助(AI Coding)等对推理时效性要求极高的场景中,MTT SGX5000 展现了卓越的推理效能。针对 Agent 间的高频通讯与复杂代码块的瞬时生成需求,MTT SGX5000 在 DeepSeek 等前沿模型的推理实测中,实现了远超行业基准的 Token 生成速率。

这种近乎“零感延迟”的输出能力确保了多智能体协作(Agent-to-Agent)时指令流转和反馈的实时性,大幅提升生产力上限,为下一代自主化、协作化 AI 应用奠定坚实的性能底座。


≥4000Tokens/s

单卡 Prefill 吞吐

ISL 为 4K,mean TTFT<=4s;MTP on;方案为 PD 分离推理,基于 2P4D 的集群配置方案,硬件为 6 台 SGX5000 8 卡服务器,软件为硅基流动的高性能推理引擎和摩尔线程底层软件栈,测试基于原生 FP8 计算精度,测试条件和高负载生产环境保持一致。

≥1000Tokens/s

单卡 Decode 吞吐

ISL/OSL 为 1K/2K;mean TPOT<=100ms;MTP on;方案为 PD 分离推理,基于 2P4D 的集群配置方案,硬件为 6 台 SGX5000 8 卡服务器,软件为硅基流动的高性能推理引擎和摩尔线程底层软件栈,测试基于原生 FP8 计算精度,测试条件和高负载生产环境保持一致。


产品组合


软硬一体 开箱即用

夸娥(MTT KUAE)是以全功能 GPU 为底座,软硬一体化、完整的系统级算力解决方案,
包括以夸娥计算集群为核心的基础设施、夸娥集群管理平台(KUAE Platform)以及夸娥大模型平台(KUAE ModelStudio),
旨在以一体化交付的方式解决大规模 GPU 算力的建设和运营管理问题。

核心能力

夸娥(MTT KUAE)全栈解决方案能够充分发挥摩尔线程 GPU 的优势

全能算力引擎

驱动跨学科科技前沿的创新研发


MTT SGX5000 凭借其从 FP8 到 FP64 的全精度计算能力,以统一通用架构灵活应对高精度与混合精度的 AI+ 计算任务,广泛适用于量子科技、具身智能、世界模型、医疗影像、基因研究、工业大模型、物理仿真、分子动力学等前沿应用场景。

AI + 量子科技

AI + 量子科技 量子科技

AI + 具身智能

AI + 具身智能 具身智能

AI + 医疗影像分析

AI + 医疗影像分析 医疗影像

AI + 基因研究

AI + 基因研究 基因研究

AI + 工业大模型

AI + 工业大模型 工业模型

AI + 物理仿真计算

AI + 物理仿真计算 物理仿真

AI + 分子动力学

AI + 分子动力学 分子动力

MTT SGX5000

产品规格

服务器形态
8U 机架式服务器
GPU
8 卡 OAM 计算模组
CPU
2 x X86 或 C86 处理器
内存
支持 2TB DDR5-5600MHZ 以上 RDIMM 内存模块;
训练典配支持 32 x 64GB 或 24 x 96GB*
系统盘
2 x 960GB 6G SATA 2.5in RI SSD
数据盘
4 x 3.84TB PCIe x Gen4 X4 NVMe U.2 2.5in RI SSD
GPU 网络
8 x 单端口 400Gb InfiniBand HDR/Ethernet CX7 适配卡
存储网络
1 x 双端口 100Gb RoCE Ethernet 适配卡
业务网络
1 x 2 端口 25Gb 光接口网卡
业务网络光模块
2 x 25G SFP28 光模块 (850nm,100m,SR,MM,LC)
管理网
1 x 单口千兆电口
额定功耗
11.4 KW
整机重量
100 KG

*注:具体支持配置清单以交付的最终解决方案为准。

phone phone
人工
客服
400-667-5666

周一至周日,9:00-21:00