通过 Python 和 SQL 接口统一多模态数据处理、智能计算与持续学习,并从本地环境无缝扩展到 Ray 集群。
import vane vane.configure(runner="ray") con = vane.connect() assets = con.sql(""" SELECT asset_id, uri, media_type FROM read_parquet('s3://raw-assets/*.parquet') WHERE media_type IN ('image', 'video', 'audio') """) features = assets.map_batches( DecodeAndInfer, # user UDF; 1 model load/actor schema=feature_schema, # explicit user schema gpus=1, actor_number=4, ) features.write_parquet("s3://model-ready/features/")
从多模态模型训练到企业数据流水线,真实 AI 工作负载运行在多样化数据之上。选择与你的工作负载匹配的流水线。
针对音频、视频、文档和图像工作负载,评测多模态 AI 流水线的推理性能。
36 CPU cores · 64 GB RAM2080 Ti (显存改装版) · 22 GB GPU memory
本次单机测试参考了 Ray Data 多模态 AI benchmark的 workload 设计。Daft 在图像和音频 workload 中出现 OOM,可能与测试机器的可用内存有限有关;较早一代的 2080 Ti GPU 也限制了整体吞吐。受当前硬件与算力预算限制,我们尚未复现原 benchmark 的完整集群规模;这些结果仅代表所记录单机环境下的实测表现。
统一数据、模型与 Agent,支持持续学习,并将可扩展执行能力从本地设备延伸到 Ray 集群。