跳到主要内容
Vane Data

概览

Vane Data 是面向 AI 工作负载的高性能、多模态原生数据引擎。它基于 DuckDB 分支构建,在核心执行引擎之上扩展原生多模态处理能力,并提供统一的本地与分布式执行框架。

多模态输入输出 / 结果
传感器
表格
文档
图像
视频
音频
事件
embeddings

Vane Data

原生多模态数据模型
计算 + 推理算子图
并行 CPU-GPU-IO 执行
云边一体部署
接入解析转换推理增强打包
可直接送入模型的多模态资产
带来源依据的上下文包
Agent 行动建议
轨迹与学习更新

Vane Core

local runtime+Ray Runtime

统一的多模态数据语义

传感器、元数据、血缘和 model artifacts 放在同一套执行语义下。

streaming、backpressure 与 dynamic batching

大对象持续流动,批量大小随压力自动调整。

异构执行重叠调度

CPU、GPU、IO 和模型推理通过 async scheduling 重叠执行。

云边协同

同一条流水线可跨本地设备和 Ray 集群运行。

核心能力

  • 多模态原生处理 — 通过统一类型系统处理图像、视频、音频、文本、文档、事件、传感器数据和表格。动态批处理与背压控制可适应数据规模和计算开销的波动。
  • Python 与 SQL 接口 — 使用 DuckDB SQL 或 Python Relation API 构建数据与 AI 流水线。
  • 内置 AI 算子 — 通过 OpenAI 和 Anthropic API 或原生 vLLM 集成调用 LLM、生成 embedding 并执行批量推理。基于前缀感知的分桶可提升 vLLM 前缀缓存命中率与推理吞吐。
  • 异构执行 — 通过异步调度重叠 CPU、GPU、I/O 与模型推理工作负载。
  • 本地到云端的一致执行 — 同一条流水线既可在本地运行,也可扩展到分布式 Ray 集群,并为后续云边协同提供基础。
  • 专为生产级 AI 工作负载设计 — 构建多模态训练数据预处理流水线与企业级大规模批量推理工作流。