Traditional Pipeline阶段屏障 · 更长关键路径
CPU解码
GPU等待推理
I/O写入
阶段屏障使 CPU 解码、GPU 推理和 I/O 串行执行,GPU 需要等待解码批次。
传统流水线会形成阶段屏障和流水线气泡。Vane 通过流式执行与动态批处理,将 CPU、GPU 和 I/O 工作负载重叠调度。

阶段屏障使 CPU 解码、GPU 推理和 I/O 串行执行,GPU 需要等待解码批次。
Dynamic batching 让 CPU 解码、GPU 推理和 I/O 流式传输重叠,更早完成同一条流水线。
从数据准备到 embedding,多模态 AI 工作负载的核心瓶颈是流水线效率。Vane 最大化端到端吞吐。
多模态数据工作流通常需要多套系统和多层编排。Vane 将数据处理、AI 推理与数据集准备统一到一张执行图中。
文件选择、媒体解码、GPU caption/自动标注、质量过滤、去重、embedding 和发布打包都在同一条可读流水线里完成。
import vane con = vane.connect() raw = con.sql(""" SELECT id, uri, media_type, content_hash FROM read_parquet('s3://training-corpus/*.parquet') WHERE split = 'train' """) def CaptionAndScore(table): ... labeled = raw.map_batches( CaptionAndScore, schema=release_schema, gpus=1, ) labeled.to_table("labeled") release = con.sql(""" SELECT id, uri, caption, quality_score, ai_embed( caption, provider := 'transformers', model := 'sentence-transformers/all-MiniLM-L6-v2' ) AS caption_embedding FROM labeled WHERE quality_score >= 0.8 QUALIFY row_number() OVER ( PARTITION BY content_hash ORDER BY quality_score DESC ) = 1 """) release.write_parquet("s3://dataset-releases/mm-v42/part-00000.parquet")