摘要由 AI 生成
2026 年 9 月 6 日,Perplexity 宣布推出 Fast Embeddings 功能,依托 Hopper 及 Blackwell 等成熟 GPU 硬件支撑其 pplx-embed 及排名模型。该方案未构建独立引擎,而是复用 LLM 栈中的预填充与解码内核,由 Ivy(Rust HTTP 网关)、Tulip(gRPC 推理服务器)和 ROSE(推理引擎)协同处理请求。针对小批量场景,团队通过修改上游 FlashInfer 以支持全模型 CUDA 图捕获,并结合延迟捕获机制及 LazyTensor 技术优化 CPU-GPU 交互效率。
关键实体KEY ENTITIES
IvyPerplexityROSETulip
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- Perplexity1
- Ivy1
- Tulip1
- ROSE1
全部报道(1)SOURCES
↗
Perplexity 发布 Fast Embeddings,利用 GPU 基础设施支撑其 pplx-embed 及排名模型。团队指出,在成熟 Hopper 和 Blackwell 硬件上,GPU 端嵌入推理已趋于收敛,核心优化在于运行时与工具集,包括 CUDA 图管理、异步结果追踪抽象及 Rust 请求路径。Perplexity 未构建独立引擎,而是复用 LLM 栈中的预填充和解码内核,由 Ivy(Rust HTTP 网关)、Tulip(gRPC 推理服务器)和 ROSE(推理引擎)协同处理请求。针对小批量场景,团队通过向上游 FlashInfer 提交更改以支持全模型 CUDA 图捕获,并采用延迟捕获机制及 LazyTensor 技术优化 CPU-GPU 交互效率。