高性能推理引擎
vLLM 是开源的高吞吐大模型推理与服务引擎,通过 PagedAttention 显著提升吞吐,常用于自托管。
信息更新时间:2026-09-20。本站仅提供工具索引,具体功能、价格与授权请以 官方网站 公示为准。
自托管推理、服务
如果你正在对比同类产品,可以看看下方推荐的替代工具,或直接浏览 AI 编程开发 分类下的全部工具。
兼容 OpenAI API 风格。
大模型需 GPU 支持。
在终端中协作编程的 AI 智能体
VS Code 中的开源自主编程智能体
AI 原生的代码编辑器
使用最广的 AI 编程助手