E2E Latency
端到端延迟:从发送请求到收齐完整响应,含网络、排队与生成。
一体机开箱只是开始。元枢把上线验收做成标准交付件:按 C1→C16 并发档位扫测,给出成功率、TTFT / E2E、Output TPS,以及推荐交互并发与吞吐边界——客户可签字、可归档、可对 SLA。
硬件与预装模型负责「能跑」;本报告负责「跑得怎样、按哪档容量签核」——与 FDE 驻场同一条链路。
按模型规模与合规选 32B / 70B / 671B 或 GPU 集群 BOM。
DeepSeek 一体机 →私有化推理服务、API 端点、流式输出与环境预配置。
AI 管理平台 →受控环境下 C1→C16 扫测,归档 JSON / 趋势图 / Markdown 摘要。
本页六项判定 + 推荐交互并发 / 吞吐边界;可选补充 SLA 对照页。
预约签核沟通 →对标行业客户验收件结构——先写结论与容量建议,再展开明细表。下列为交付样例字段(数值随项目实测填写)。
测试完整,指标可交付
全程目标成功率 100%;累计请求按档位 n×10 设计(如 C1–C16 共 180)。
记录 Output TPS / Total TPS 峰值及对应并发档(示例:峰值常落在 C16)。
默认推荐 C4——首包、端到端延迟与吞吐之间较均衡。
C16 作为吞吐优先场景容量边界;高延迟属容量特征,非故障。
报告适用范围:客户验收交付;并发档位 C1 / C2 / C4 / C8 / C16。硬件与量化栏可按项目填写,也可刻意留空——焦点放在服务级指标。
| 测试模型 | 按项目:DeepSeek-R1 / V3、GLM 等私有化推理服务 |
|---|---|
| API 端点 | /v1/chat/completions(客户内网或专线地址) |
| 并发档位 | C1 / C2 / C4 / C8 / C16(每档固定请求数,累计可复现) |
| 输出 / 流式 | 正常输出(模型自然停止)· 流式 SSE |
| Temperature | 默认(或合同约定) |
| 推理后端 / 量化 | 按现场填写;可留空以强调服务级验收 |
样例表结构与指标列与行业验收报告对齐。真实数值在客户现场扫测后写入 PDF / Markdown。
| 并发 | 请求数 | 成功率 | E2E Avg | E2E P95 | TTFT | TPOT | Output TPS | Total TPS | RPS |
|---|---|---|---|---|---|---|---|---|---|
| C1 | 20 | 100% | — | — | — | — | — | — | — |
| C2 | 20 | 100% | — | — | — | — | — | — | — |
| C4 推荐 | 20 | 100% | — | — | — | — | — | — | — |
| C8 | 40 | 100% | — | — | — | — | — | — | — |
| C16 边界 | 80 | 100% | — | — | — | — | — | — | — |
注:TTFT / E2E 随并发增大属正常现象;高并发档位为吞吐优先场景。单位:秒 / tok/s。
通过才出具客户提交版;任一项不达标则复测或调整容量建议后再签核。
| 验收项目 | 目标结果 | 说明 |
|---|---|---|
| 测试完整性 | 通过 | 覆盖约定并发档位,请求数与时长可追溯 |
| 服务可用性 | 通过 | 测试期间服务响应正常,无崩溃或不可用 |
| 稳定性 | 通过 | 目标总成功率 100%,无失败请求(或合同约定阈值) |
| 峰值吞吐量 | 通过 | 峰值 Output TPS 满足部署需求 |
| 交付建议适配性 | 通过 | 给出推荐交互并发与吞吐边界 |
| 数据可追溯性 | 通过 | 原始 JSON、趋势图、Markdown 摘要归档 |
端到端延迟:从发送请求到收齐完整响应,含网络、排队与生成。
首 Token 时延:到第一个输出 Token 的时间,反映响应敏捷度。
每 Token 生成时间与 Token 间延迟,刻画流式体验平滑度。
系统级输出 Token 吞吐量(tok/s),容量与成本讨论的核心指标。
输入 + 输出总 Token 吞吐,衡量整体算力利用率。
每秒完成请求数;与并发档位、成功率一起读。
边界说明:本页展示的是元枢标准验收件结构;具体数值以客户现场受控扫测为准。最高测试并发之外需另行测试。默认不设定 SLA 阈值,正式 SLA 与业务协商确定。