用例

Vane 适合哪些 AI 工作流

常见生产场景示例,每个用例都说明问题、流水线、代码、输入输出和适用时机。

网页文本转嵌入

embedding
WARC 行解码英文页面文本分块vane.ai.embed写出文件
问题

网页抓取记录需要经过解码、语言过滤、分块、嵌入和写出,同时保留稳定的来源 ID。

输入 / 输出
输入
5 条内置 WARC 形态记录
输出
3 个英文页面 · 7 个分块 · 384 维嵌入
何时使用

从 Common Crawl WET/WARC 输入准备检索或训练数据时使用。

common_crawl.py
# Uses the default Ray runner
python examples/common_crawl.py
示例: examples/common_crawl.py打开示例

文本去重

预处理
标准化MinHashLSH 候选连通分量保留一条
问题

近重复文本需要以可复现方式分组,并保留可检查的候选对与聚类决策。

输入 / 输出
输入
10 条内置文档
输出
5 条保留代表记录 + 审计 CSV
何时使用

在分词、训练或嵌入前清洗文本时使用。

minhash_dedupe.py
# No model-specific dependency required
python examples/minhash_dedupe.py
示例: examples/minhash_dedupe.py打开示例

图像流水线

视觉
图像字节AnalyzeRedRegionsBatch排序保存图像保存遮罩
问题

图像字节需要批量解码与分析,同时保留元数据并输出可检查的预览。

输入 / 输出
输入
5 张生成的样例图片
输出
排序元数据 · PNG 预览 · 红色区域遮罩
何时使用

在接入真实数据集前验证图像 UDF 批处理与文件输出时使用。

querying_images.py
# Pillow is the only example-specific dependency
python examples/querying_images.py
示例: examples/querying_images.py打开示例

图像生成

生成
提示词数据GenerateImageFromTextBatchPNG 文件元数据 CSV
问题

提示词表需要可复现的批量生成路径,并用清单把每张图片与来源行关联起来。

输入 / 输出
输入
4 条内置提示词
输出
4 张确定性占位 PNG + 元数据
何时使用

在启用扩散模型和 GPU 前,本地检查流水线行为时使用。

image_generation.py
# Placeholder is the default backend
python examples/image_generation.py
示例: examples/image_generation.py打开示例

多模态结构化输出

多模态
合成图像+问题带图 VLM纯文本 VLM对比可选评审
问题

视觉语言模型的回答需要类型化解析,并与去掉图片后的同一问题进行受控对比。

输入 / 输出
输入
1 张合成选择题图片 + 服务商密钥
输出
类型化答案 + 评估象限
何时使用

评估 VLM 是否真正使用视觉证据并诊断失败时使用。

multimodal_structured_outputs.py
export OPENAI_API_KEY=your_provider_token
python examples/multimodal_structured_outputs.py --limit 1 --skip-judge
示例: examples/multimodal_structured_outputs.py打开示例

语音 AI 分析

音频
音频数据转写摘要字幕分段vane.ai.embed
问题

音频分析需要把转写级元数据与每个字幕分段的可搜索嵌入组合起来。

输入 / 输出
输入
3 段生成的 WAV 样例
输出
3 条转写/摘要 · 6 个嵌入分段
何时使用

在启用 Whisper 或托管摘要前验证音频到检索流水线时使用。

voice_ai_analytics.py
# Placeholder transcription; local summary; real embeddings
python examples/voice_ai_analytics.py
示例: examples/voice_ai_analytics.py打开示例

用多模态数据跑起第一条 AI 流水线