基准测试

单机多模态流水线基准测试

Benchmark 测试流程见这里

主要结果

batch size 调优结果

测试环境: 单机 · 36 个 CPU 核心 · 64 GB 内存 · 2080 Ti (显存改装版) · 22 GB 显存

端到端耗时(秒)
batch size 调优后 · 对数尺度 · 越低越好
Vane DataRay DataDaft
86.09127413
文档
1.15k1.77kOOM
图像
2.31k2.36kOOM
音频
7.60k6.92k8.32k
视频

本次单机测试参考了 Ray Data 多模态 AI benchmark的 workload 设计。Daft 在图像和音频 workload 中出现 OOM,可能与测试机器的可用内存有限有关;较早一代的 2080 Ti GPU 也限制了整体吞吐。受当前硬件与算力预算限制,我们尚未复现原 benchmark 的完整集群规模;这些结果仅代表所记录单机环境下的实测表现。

工作负载Vane DataRay DataDaft对比 Ray Data对比 Daft
文档86.09 sBatch size: 2560127 sBatch size: 320413 sBatch size: 2032.2% 更低79.2% 更低
图像1147 sBatch size: 1001767.11 sBatch size: 100OOM35.1% 更低OOM
音频2312 sBatch size: 1282363.08 sBatch size: 128OOM2.2% 更低OOM
视频7603 sBatch size: 326922 sBatch size: 328322 sBatch size: 未设置9.8% 更高8.6% 更低
参考结果

默认 batch size 结果

同一台已记录单机环境中,未按引擎调整 batch size 时的结果。

端到端耗时(秒)
默认 batch size · 对数尺度 · 越低越好
Vane DataRay DataDaft
187209732.99
文档
1.19k2.04kOOM
图像
2.64k2.88kOOM
音频
7.60k6.92k8.32k
视频

本次单机测试参考了 Ray Data 多模态 AI benchmark的 workload 设计。Daft 在图像和音频 workload 中出现 OOM,可能与测试机器的可用内存有限有关;较早一代的 2080 Ti GPU 也限制了整体吞吐。受当前硬件与算力预算限制,我们尚未复现原 benchmark 的完整集群规模;这些结果仅代表所记录单机环境下的实测表现。

用多模态数据跑起第一条 AI 流水线