为大模型训练集群优化的服务器硬件系统
为大模型推理效率/性价比优化的服务器硬件系统
支持兼容主流软硬件生态的 GPU 服务器硬件系统
FP8 原生算力
万亿模型训练和推理的算力标准
在大模型参数持续扩张的趋势下,FP8 计算精度的支持已成为训练与推理前沿模型的核心精度标准。MTT SGX5000 率先实现硬件级原生 FP8 计算精度支持,在确保模型收敛的同时显著降低显存占用。针对大规模集群面临的带宽与算力瓶颈,MTT SGX5000 的 FP8 引擎全面支持 DeepSeek、Qwen 等前沿架构,训练性能提升超 30%,并大幅优化总体拥有成本。
面向万亿级参数大模型训练的万卡集群标杆
面对万亿参数大模型对算力规模与工程稳定性的极致挑战,MTT SGX5000 以前瞻性架构设计实现从单卡到万卡集群的线性性能跃升。在万卡级超大规模预训练实测中,MTT SGX5000 展现出卓越的精度一致性,训练效果与国际旗舰产品高度对齐。凭借突破性的算力利用率(MFU)表现,确保大规模训练任务的确定性交付与极致性能。

综合训练性能
多模态微调超越:在多模态大模型微调任务中,实测性能表现优于国际旗舰产品① 。

大规模集群高效率
DeepSeek-236B 训练:模型算力利用率 (MFU) 超过 40%。

万卡集群高精度
下游表现更优:在同等数据量下,下游任务评测得分优于国际旗舰产品①,验证了万卡集群的高精度。

集群扩展

可靠、可用和可维护
MTT SGX5000 从芯片级到系统级全面构建 RAS 体系,支持故障感知、上报与错误隔离,可快速定位并替换故障节点、慢节点及静默数据损坏节点;主动检测与修复,长期守护集群健康,确保性能稳定与结果正确。依托芯片级到系统级的 RAS 能力,MTT SGX5000 将万卡集群的训练成功率提升超 30%。
瞬时响应与极速交互
打造大模型推理的极致用户体验
MTT SGX5000 致力于打破算力与交互之间的屏障,通过软硬一体化深度协同,为 AI 应用提供近乎零延迟的响应体验。针对大语言模型推理场景,MTT SGX5000 进行了全栈式优化,通过集成 SGLang、vLLM 等高性能推理软件栈,充分发挥硬件架构在长序列处理与高频解码中的算力优势。
在长文本上下文理解任务中,MTT SGX5000 显著提升了预填充(Prefill)阶段效率,有效降低首 Token 延迟,确保复杂指令的即时响应。在内容生成阶段,通过深度优化解码(Decode)吞吐性能,实现了出众的文本输出速率。这一推理效能不仅满足用户对极速交互的需求,更在高并发访问场景下,为企业提供了更优的算力能效比与稳定的服务保障。

Prefill 性能飞跃
实现长文本瞬时首字响应
在 16k 长序列输入测试中,MTT SGX5000 单卡 Prefill 吞吐量是国际旗舰产品② 的 2.5 倍。这意味着在处理长文本 Prompt 时,国产算力具备更快的上下文理解速度。
以极速交互表现赋能智能体与 AI 编程
在智能体交互(Agentic AI)与 AI 编程辅助(AI Coding)等对推理时效性要求极高的场景中,MTT SGX5000 展现了卓越的推理效能。针对 Agent 间的高频通讯与复杂代码块的瞬时生成需求,MTT SGX5000 在 DeepSeek 等前沿模型的推理实测中,实现了远超行业基准的 Token 生成速率。
这种近乎“零感延迟”的输出能力确保了多智能体协作(Agent-to-Agent)时指令流转和反馈的实时性,大幅提升生产力上限,为下一代自主化、协作化 AI 应用奠定坚实的性能底座。
≥4000Tokens/s
单卡 Prefill 吞吐
ISL 为 4K,mean TTFT<=4s;MTP on;方案为 PD 分离推理,基于 2P4D 的集群配置方案,硬件为 6 台 SGX5000 8 卡服务器,软件为硅基流动的高性能推理引擎和摩尔线程底层软件栈,测试基于原生 FP8 计算精度,测试条件和高负载生产环境保持一致。
≥1000Tokens/s
单卡 Decode 吞吐
ISL/OSL 为 1K/2K;mean TPOT<=100ms;MTP on;方案为 PD 分离推理,基于 2P4D 的集群配置方案,硬件为 6 台 SGX5000 8 卡服务器,软件为硅基流动的高性能推理引擎和摩尔线程底层软件栈,测试基于原生 FP8 计算精度,测试条件和高负载生产环境保持一致。
产品组合
软硬一体 开箱即用
夸娥(MTT KUAE)是以全功能 GPU 为底座,软硬一体化、完整的系统级算力解决方案,
包括以夸娥计算集群为核心的基础设施、夸娥集群管理平台(KUAE Platform)以及夸娥大模型平台(KUAE ModelStudio),
旨在以一体化交付的方式解决大规模 GPU 算力的建设和运营管理问题。
核心能力
夸娥(MTT KUAE)全栈解决方案能够充分发挥摩尔线程 GPU 的优势
全能算力引擎
驱动跨学科科技前沿的创新研发
MTT SGX5000 凭借其从 FP8 到 FP64 的全精度计算能力,以统一通用架构灵活应对高精度与混合精度的 AI+ 计算任务,广泛适用于量子科技、具身智能、世界模型、医疗影像、基因研究、工业大模型、物理仿真、分子动力学等前沿应用场景。
AI + 量子科技 量子科技
AI + 具身智能 具身智能
AI + 医疗影像分析 医疗影像
AI + 基因研究 基因研究
AI + 工业大模型 工业模型
AI + 物理仿真计算 物理仿真
AI + 分子动力学 分子动力
MTT SGX5000
产品规格
训练典配支持 32 x 64GB 或 24 x 96GB*
*注:具体支持配置清单以交付的最终解决方案为准。

EN

