Vane Data
概览
Vane Data 是面向 AI 工作负载的高性能、多模态原生数据引擎。它基于 DuckDB 分支构建,在核心执行引擎之上扩展原生多模态处理能力,并提供统一的本地与分布式执行框架。
核心能力
- 多模态原生处理 — 通过统一类型系统处理图像、视频、音频、文本、文档、事件、传感器数据和表格。动态批处理与背压控制可适应数据规模和计算开销的波动。
- Python 与 SQL 接口 — 使用 DuckDB SQL 或 Python Relation API 构建数据与 AI 流水线。
- 内置 AI 算子 — 通过 OpenAI 和 Anthropic API 或原生 vLLM 集成调用 LLM、生成 embedding 并执行批量推理。基于前缀感知的分桶可提升 vLLM 前缀缓存命中率与推理吞吐。
- 异构执行 — 通过异步调度重叠 CPU、GPU、I/O 与模型推理工作负载。
- 本地到云端的一致执行 — 同一条流水线既可在本地运行,也可扩展到分布式 Ray 集群,并为后续云边协同提供基础。
- 专为生产级 AI 工作负载设计 — 构建多模态训练数据预处理流水线与企业级大规模批量推理工作流。