推理框架 分类 - AI 工具网

关于本分类

AI 推理框架是部署和运行大模型的底层软件,负责模型加载、量化、批处理与算力调度。本分类涵盖主流推理引擎与服务框架。

适用场景:本地大模型推理部署、模型量化与加速、高并发推理服务、多模型路由与负载均衡、边缘端部署

使用建议:选择框架时关注硬件兼容性(CUDA/CPU/Apple Silicon)、量化支持与社区生态;个人机器优先选对消费级显卡友好的方案。

Q:推理框架和训练框架有什么区别?

训练框架用于模型学习参数,推理框架专注于已训练模型的快速、低延迟执行,二者侧重点不同。

Q:量化会影响效果吗?

适度量化可大幅降低显存与延迟,通常仅有轻微精度损失,极端量化才明显影响输出质量。

站长亲测

真实推荐 · 含推广链接

热门工具

24 个工具
TensorRT-LLM

TensorRT-LLM

开源

NVIDIA 官方的 LLM 推理优化库,用于在英伟达 GPU 上做高吞吐的生产级推理服务。用 Python API 定义模型,生成 Python / C++ 运行时,覆盖量化、MoE、KV cache 管理等优化。仓库活跃,最新稳定版 v1.2.1(2026 年 4 月),v1.3.0 仍在候选版推进。只支持 NVIDIA GPU,且 release notes 里 Known Issues 较多,版本间兼容性需要实测。适合已经在英伟达卡上跑推理、想把吞吐和延迟压到极致的服务端场景;个人轻量用途不太需要。

vLLM

vLLM

开源

目前最主流的开源大模型高性能推理引擎,由加州大学伯克利分校团队开发。核心技术是 PagedAttention,能大幅提升吞吐量并节省显存。适合需要自己部署大模型 API 的开发者和企业,支持 Llama、Qwen、DeepSeek 等主流模型,生产环境首选。

SGLang

SGLang

开源

优秀的结构化生成框架,在处理长文本与复杂 Prompt 时推理速度极快。由 LMSYS 团队开发,支持并行解码和高效注意力机制。适合需要批量生成、结构化输出(JSON/表格)的场景,比 vLLM 更适合复杂 Prompt 工程。

Ollama

Ollama

开源

在本地运行开源大模型的常用工具,通过几条命令行指令即可拉取并启动模型,无需自行编译推理框架,支持 Llama、Qwen、DeepSeek 等主流开源系列,并对外提供 OpenAI 兼容接口,方便接入既有应用。适合想在自己电脑上跑模型、做隐私敏感任务或本地开发的用户。需要注意的是,本地运行的实际速度与可用参数量取决于显卡显存,硬件条件不足时建议选择量化版本或更小参数的模型。

Mooncake/LMCache

Mooncake/LMCache

开源

Mooncake 是面向大模型推理的 KVCache 优化方案,通过把缓存从显存下沉到更大容量的存储层并做统一调度,缓解超长上下文与高并发场景下的显存压力,从而降低推理成本与响应延迟,适用于自建推理服务的团队。项目开源,主要面向有工程能力的技术团队。需要注意的是,其收益依赖存储带宽与网络条件,部署涉及较多系统层配置,落地前建议在目标硬件上做完整压测,并与现有推理框架的兼容性一并评估。

Fairseq2

Fairseq2

开源

Meta FAIR 团队开源的序列建模工具包,为语音、文本与多模态任务提供统一的数据管线、模型组件与训练脚本,面向研究与生产两端做了工程化设计。适合做序列建模实验与大规模训练的研究者与工程师。需要注意的是,工具包对硬件与依赖环境要求较高,上手前建议先跑通官方示例;版本迭代较快,升级时需要关注接口变化与权重兼容性。

Tengine

Tengine

开源

面向嵌入式与边缘设备的轻量级推理引擎,针对 ARM 等平台做了算子优化,支持常见模型的转换与部署,便于在算力受限的终端上运行神经网络。适合做边缘计算与嵌入式 AI 产品开发的团队。需要注意的是,模型转换过程中可能出现算子不支持的情况,需要做图优化或算子替换;不同芯片平台的性能差异较大,正式选型前建议在目标硬件上做基准测试。

Optimate

Optimate

开源

面向模型压缩与推理优化的开源工具集合,封装了量化、剪枝与编译等常见加速手段,帮助开发者在保持可接受精度的前提下降低模型的体积与推理成本。适合需要在有限算力上部署模型的团队。需要注意的是,不同加速手段对精度的影响需要实测评估,压缩后的模型应在真实数据上做完整回归;工具链对框架版本与硬件平台有依赖,接入前建议先验证兼容性。

Wasmedge

Wasmedge

开源

面向云原生场景的轻量级 WebAssembly 运行时,可在边缘设备与服务端高效执行 Wasm 模块,并提供面向 AI 推理的扩展支持,便于把模型推理以更小的资源开销部署到接近数据源的位置。适合做边缘计算与服务端优化的开发者。需要注意的是,Wasm 生态在部分语言与库的兼容性上仍有边界,迁移既有应用需要评估改动量;不同硬件后端的加速效果差异较大,建议实测。

Tract

Tract

一个轻量级、自包含的推理引擎,用于在服务器与边缘设备上运行 TensorFlow 与 ONNX 模型,提供命令行工具完成模型转换、量化与性能基准测试,依赖较少、部署简单,适合对体积和启动速度有要求的场景。需要注意的是,模型转换时可能遇到算子不支持的情况,需要做图改写或算子替换;不同硬件平台上的性能差异较大,正式选型前建议在目标设备上做基准对比。

Middleware

Middleware

一个开源的工程效能度量平台,围绕交付效率与稳定性指标采集代码仓库数据,自动生成趋势看板并定位瓶颈环节,帮助团队用数据评估改进效果。适合希望建立研发度量体系的技术团队。需要注意的是,指标本身容易被误用为考核工具,进而诱发数据粉饰,建议以团队自查和改进为导向;平台需要对接代码托管与协作系统,采集范围与数据权限应事先明确,避免涉及敏感信息。

Ncnn

Ncnn

腾讯开源的轻量级神经网络推理框架,针对移动端与嵌入式设备做了深度优化,支持主流模型格式的转换与部署,可在安卓、iOS 及多种芯片平台上运行,并提供量化工具减少模型体积与推理耗时。适合做移动应用与边缘设备 AI 功能开发的团队。需要注意的是,模型转换环节可能遇到算子不支持的情况,需要做图改写或算子替换;不同芯片平台上的加速效果差异明显,正式选型前建议在目标机型上做基准测试。

Sail

Sail

一个用 Rust 编写的分布式计算引擎,兼容常用的数据处理接口,可在单机或集群上执行大规模数据查询与转换任务,借助 Rust 的内存管理减少额外开销,适合在现有数据栈中替换或补充计算引擎。适合处理数据量较大、对资源占用敏感的数据工程团队。需要注意的是,项目仍在快速发展阶段,与既有生态的兼容范围和函数覆盖度需要按实际业务评估;上线前建议先在部分任务上做对比测试,确认结果一致性与性能表现。

Postgresml

Postgresml

面向 PostgreSQL 的机器学习扩展,允许在数据库内直接完成模型的训练与预测,支持多种常见算法并可选显卡加速,把特征数据与模型放在同一套系统中管理,减少数据搬运与导入导出环节。适合已有 Postgres 技术栈、希望简化机器学习流程的数据团队。需要注意的是,数据库内训练会占用实例资源,可能影响线上业务的响应,建议在只读副本或独立实例上进行;扩展版本需与数据库主版本匹配,升级前应先做兼容性验证。

Raghub

Raghub

一个围绕检索增强生成方向整理的社区资源集合,汇总主流框架、开源项目、论文与实践教程,并按用途分类,便于开发者了解技术路线与选型参考。适合正在搭建知识库问答系统的团队与技术爱好者。需要注意的是,该集合以索引与推荐为主,不提供统一的技术方案,条目质量与维护状态参差;检索增强的效果高度依赖数据切分与提示词设置,实际落地仍需要结合自有语料做专门调优与效果评估。

Leptonai

Leptonai

一个用于快速构建与部署 AI 服务的 Python 框架,把模型加载、接口封装与资源调度封装成简洁的调用方式,支持在本地或云端一键发布推理服务,并提供按需扩缩与监控能力,减少从模型到线上接口之间的工程工作量。适合需要把模型快速上线验证的算法与后端工程师。需要注意的是,框架以简化部署为目标,复杂业务所需的鉴权、限流与灰度能力仍需自行补充;云端部署会产生计算与存储费用,上线前建议先评估调用量与成本,并做好异常与超时的处理。

Litserve

Litserve

一个用于构建推理服务的轻量级 Python 框架,把模型加载、请求批处理与并发处理封装成简洁接口,支持在同一服务中挂载多个模型并自动做批量合并,从而提升显卡利用率与吞吐量。适合需要自建模型接口服务的算法与后端工程师。需要注意的是,批处理参数与并发数需要结合模型规模与硬件条件调优,设置不当反而增加延迟;服务本身不包含业务层的鉴权、限流与监控,生产环境建议配合网关与日志系统一并部署。

Cai

Cai

一个面向安全领域的开源框架,把常见的网络安全工具与人工智能能力结合,用于自动化完成信息收集、漏洞扫描与任务编排,便于在获得授权的场景中开展安全测试与研究。适合做安全评估与自动化测试的专业人员。需要注意的是,此类工具具有明显攻击属性,必须严格限定在自有资产或取得书面授权的范围内使用,未经授权对他人系统发起扫描或攻击将涉嫌违法;自动化流程可能对目标服务造成压力,使用前应评估影响并设置速率限制与回滚预案。

Bricksllm

Bricksllm

一个用 Go 语言编写的 AI 网关项目,把多家模型服务商的接口统一到同一入口,支持按密钥设置调用频率与费用上限、按用户或项目统计用量、对请求中的敏感信息做识别与脱敏,并提供缓存、重试与故障转移等可靠性能力,便于团队在下发密钥时控制成本与访问范围。适合需要在内部统一管理模型调用与预算的企业开发团队。需要注意的是,完整部署依赖数据库与缓存服务,运维有一定成本,主项目更新节奏已放缓,长期使用建议关注维护状态或评估替代方案;计费与限流规则的配置需结合业务压测验证,敏感信息识别能力有限,不能替代完整的数据安全治理。

Pai

Pai

百度开源的集群资源调度平台,面向大规模机器学习训练任务,把计算资源集中管理后按队列与配额分配给不同团队,支持训练任务的排队、抢占与优先级设置,并提供任务监控与日志查询能力,便于在自有服务器集群上统一调度 GPU 与 CPU 资源。适合拥有多卡集群、需要提升资源利用率的企业算法团队。需要注意的是,平台面向 Kubernetes 环境部署,对运维能力要求较高,安装与升级涉及较多组件,投入前应评估团队的技术储备;资源配额与抢占策略的配置直接影响到各团队的训练稳定性,建议先在测试集群验证规则,长期运行的存储与电力成本也需纳入规划。

Polyaxon

Polyaxon

一个面向机器学习团队的平台工程方案,把实验跟踪、超参数调优、流水线编排与模型部署等环节统一到同一套系统中,支持在自有 Kubernetes 集群上运行,并提供任务队列与资源调度能力,便于把零散的训练脚本整理为可复用、可追溯的工作流。适合需要规范化模型研发流程的平台与算法团队。需要注意的是,该产品的部分关键能力面向企业版,社区版的组件覆盖范围有差异,选型时应先确认所需功能所处的版本;平台自建部署带来较高的运维投入,集群规模不大时收益有限,落地前应结合团队规模与研发流程做成本收益评估。

Invokeai

Invokeai

一款开源的图像生成创作引擎,围绕 Stable Diffusion 系列模型提供可视化操作界面,支持文生图、图生图、局部重绘与画布扩展等功能,并提供统一的模型管理、工作流与队列机制,可在本地或服务器上部署运行,便于团队集中管理生成资源。适合需要长期做图像生成实验的创作者与开发团队。需要注意的是,本地运行的生成速度与可用模型规模取决于显卡显存,建议先在目标硬件上测试再决定部署方案;生成图片的版权与可商用范围因所用模型而异,涉及人物形象与特定风格时应确认授权,生成内容中可能出现的偏差与不当元素需要人工筛选后再对外使用。

Kserve

Kserve

一个面向 Kubernetes 的开源模型推理平台,通过自定义资源把模型的部署、扩缩容、网络与健康检查等运维工作标准化,支持生成式与预测式两类模型,兼容主流机器学习框架以及多种高性能推理后端,提供金丝雀发布、模型集成与缩容到零等能力,帮助团队在自有集群上统一托管模型服务。适合已有 Kubernetes 基础设施、需要规模化部署模型的平台与算法团队。需要注意的是,落地需要团队具备一定的容器与集群运维能力,平台本身不解决模型效果与数据质量问题;GPU 资源与常驻实例会产生持续成本,建议结合调用量配置扩缩策略,多租户场景下的隔离与权限控制也需要额外规划。

Caffe2

Caffe2

开源

Caffe2 是 Facebook 开源的轻量级深度学习框架,强调模块化与移动端部署,曾是生产环境部署模型的常见选择。项目现已并入 PyTorch,官方不再单独维护,此处仅作为历史资料与旧系统维护的参考,新项目建议直接使用 PyTorch 生态。

AI 编程27 个工具

TensorRT-LLM

TensorRT-LLM

开源

NVIDIA 官方的 LLM 推理优化库,用于在英伟达 GPU 上做高吞吐的生产级推理服务。用 Python API 定义模型,生成 Python / C++ 运行时,覆盖量化、MoE、KV cache 管理等优化。仓库活跃,最新稳定版 v1.2.1(2026 年 4 月),v1.3.0 仍在候选版推进。只支持 NVIDIA GPU,且 release notes 里 Known Issues 较多,版本间兼容性需要实测。适合已经在英伟达卡上跑推理、想把吞吐和延迟压到极致的服务端场景;个人轻量用途不太需要。

vLLM

vLLM

开源

目前最主流的开源大模型高性能推理引擎,由加州大学伯克利分校团队开发。核心技术是 PagedAttention,能大幅提升吞吐量并节省显存。适合需要自己部署大模型 API 的开发者和企业,支持 Llama、Qwen、DeepSeek 等主流模型,生产环境首选。

SGLang

SGLang

开源

优秀的结构化生成框架,在处理长文本与复杂 Prompt 时推理速度极快。由 LMSYS 团队开发,支持并行解码和高效注意力机制。适合需要批量生成、结构化输出(JSON/表格)的场景,比 vLLM 更适合复杂 Prompt 工程。

Mooncake/LMCache

Mooncake/LMCache

开源

Mooncake 是面向大模型推理的 KVCache 优化方案,通过把缓存从显存下沉到更大容量的存储层并做统一调度,缓解超长上下文与高并发场景下的显存压力,从而降低推理成本与响应延迟,适用于自建推理服务的团队。项目开源,主要面向有工程能力的技术团队。需要注意的是,其收益依赖存储带宽与网络条件,部署涉及较多系统层配置,落地前建议在目标硬件上做完整压测,并与现有推理框架的兼容性一并评估。

Fairseq2

Fairseq2

开源

Meta FAIR 团队开源的序列建模工具包,为语音、文本与多模态任务提供统一的数据管线、模型组件与训练脚本,面向研究与生产两端做了工程化设计。适合做序列建模实验与大规模训练的研究者与工程师。需要注意的是,工具包对硬件与依赖环境要求较高,上手前建议先跑通官方示例;版本迭代较快,升级时需要关注接口变化与权重兼容性。

Tengine

Tengine

开源

面向嵌入式与边缘设备的轻量级推理引擎,针对 ARM 等平台做了算子优化,支持常见模型的转换与部署,便于在算力受限的终端上运行神经网络。适合做边缘计算与嵌入式 AI 产品开发的团队。需要注意的是,模型转换过程中可能出现算子不支持的情况,需要做图优化或算子替换;不同芯片平台的性能差异较大,正式选型前建议在目标硬件上做基准测试。

Optimate

Optimate

开源

面向模型压缩与推理优化的开源工具集合,封装了量化、剪枝与编译等常见加速手段,帮助开发者在保持可接受精度的前提下降低模型的体积与推理成本。适合需要在有限算力上部署模型的团队。需要注意的是,不同加速手段对精度的影响需要实测评估,压缩后的模型应在真实数据上做完整回归;工具链对框架版本与硬件平台有依赖,接入前建议先验证兼容性。

Wasmedge

Wasmedge

开源

面向云原生场景的轻量级 WebAssembly 运行时,可在边缘设备与服务端高效执行 Wasm 模块,并提供面向 AI 推理的扩展支持,便于把模型推理以更小的资源开销部署到接近数据源的位置。适合做边缘计算与服务端优化的开发者。需要注意的是,Wasm 生态在部分语言与库的兼容性上仍有边界,迁移既有应用需要评估改动量;不同硬件后端的加速效果差异较大,建议实测。

Tract

Tract

一个轻量级、自包含的推理引擎,用于在服务器与边缘设备上运行 TensorFlow 与 ONNX 模型,提供命令行工具完成模型转换、量化与性能基准测试,依赖较少、部署简单,适合对体积和启动速度有要求的场景。需要注意的是,模型转换时可能遇到算子不支持的情况,需要做图改写或算子替换;不同硬件平台上的性能差异较大,正式选型前建议在目标设备上做基准对比。

Middleware

Middleware

一个开源的工程效能度量平台,围绕交付效率与稳定性指标采集代码仓库数据,自动生成趋势看板并定位瓶颈环节,帮助团队用数据评估改进效果。适合希望建立研发度量体系的技术团队。需要注意的是,指标本身容易被误用为考核工具,进而诱发数据粉饰,建议以团队自查和改进为导向;平台需要对接代码托管与协作系统,采集范围与数据权限应事先明确,避免涉及敏感信息。

Ncnn

Ncnn

腾讯开源的轻量级神经网络推理框架,针对移动端与嵌入式设备做了深度优化,支持主流模型格式的转换与部署,可在安卓、iOS 及多种芯片平台上运行,并提供量化工具减少模型体积与推理耗时。适合做移动应用与边缘设备 AI 功能开发的团队。需要注意的是,模型转换环节可能遇到算子不支持的情况,需要做图改写或算子替换;不同芯片平台上的加速效果差异明显,正式选型前建议在目标机型上做基准测试。

Sail

Sail

一个用 Rust 编写的分布式计算引擎,兼容常用的数据处理接口,可在单机或集群上执行大规模数据查询与转换任务,借助 Rust 的内存管理减少额外开销,适合在现有数据栈中替换或补充计算引擎。适合处理数据量较大、对资源占用敏感的数据工程团队。需要注意的是,项目仍在快速发展阶段,与既有生态的兼容范围和函数覆盖度需要按实际业务评估;上线前建议先在部分任务上做对比测试,确认结果一致性与性能表现。

Postgresml

Postgresml

面向 PostgreSQL 的机器学习扩展,允许在数据库内直接完成模型的训练与预测,支持多种常见算法并可选显卡加速,把特征数据与模型放在同一套系统中管理,减少数据搬运与导入导出环节。适合已有 Postgres 技术栈、希望简化机器学习流程的数据团队。需要注意的是,数据库内训练会占用实例资源,可能影响线上业务的响应,建议在只读副本或独立实例上进行;扩展版本需与数据库主版本匹配,升级前应先做兼容性验证。

Raghub

Raghub

一个围绕检索增强生成方向整理的社区资源集合,汇总主流框架、开源项目、论文与实践教程,并按用途分类,便于开发者了解技术路线与选型参考。适合正在搭建知识库问答系统的团队与技术爱好者。需要注意的是,该集合以索引与推荐为主,不提供统一的技术方案,条目质量与维护状态参差;检索增强的效果高度依赖数据切分与提示词设置,实际落地仍需要结合自有语料做专门调优与效果评估。

Leptonai

Leptonai

一个用于快速构建与部署 AI 服务的 Python 框架,把模型加载、接口封装与资源调度封装成简洁的调用方式,支持在本地或云端一键发布推理服务,并提供按需扩缩与监控能力,减少从模型到线上接口之间的工程工作量。适合需要把模型快速上线验证的算法与后端工程师。需要注意的是,框架以简化部署为目标,复杂业务所需的鉴权、限流与灰度能力仍需自行补充;云端部署会产生计算与存储费用,上线前建议先评估调用量与成本,并做好异常与超时的处理。

Litserve

Litserve

一个用于构建推理服务的轻量级 Python 框架,把模型加载、请求批处理与并发处理封装成简洁接口,支持在同一服务中挂载多个模型并自动做批量合并,从而提升显卡利用率与吞吐量。适合需要自建模型接口服务的算法与后端工程师。需要注意的是,批处理参数与并发数需要结合模型规模与硬件条件调优,设置不当反而增加延迟;服务本身不包含业务层的鉴权、限流与监控,生产环境建议配合网关与日志系统一并部署。

Cai

Cai

一个面向安全领域的开源框架,把常见的网络安全工具与人工智能能力结合,用于自动化完成信息收集、漏洞扫描与任务编排,便于在获得授权的场景中开展安全测试与研究。适合做安全评估与自动化测试的专业人员。需要注意的是,此类工具具有明显攻击属性,必须严格限定在自有资产或取得书面授权的范围内使用,未经授权对他人系统发起扫描或攻击将涉嫌违法;自动化流程可能对目标服务造成压力,使用前应评估影响并设置速率限制与回滚预案。

Bricksllm

Bricksllm

一个用 Go 语言编写的 AI 网关项目,把多家模型服务商的接口统一到同一入口,支持按密钥设置调用频率与费用上限、按用户或项目统计用量、对请求中的敏感信息做识别与脱敏,并提供缓存、重试与故障转移等可靠性能力,便于团队在下发密钥时控制成本与访问范围。适合需要在内部统一管理模型调用与预算的企业开发团队。需要注意的是,完整部署依赖数据库与缓存服务,运维有一定成本,主项目更新节奏已放缓,长期使用建议关注维护状态或评估替代方案;计费与限流规则的配置需结合业务压测验证,敏感信息识别能力有限,不能替代完整的数据安全治理。

Pai

Pai

百度开源的集群资源调度平台,面向大规模机器学习训练任务,把计算资源集中管理后按队列与配额分配给不同团队,支持训练任务的排队、抢占与优先级设置,并提供任务监控与日志查询能力,便于在自有服务器集群上统一调度 GPU 与 CPU 资源。适合拥有多卡集群、需要提升资源利用率的企业算法团队。需要注意的是,平台面向 Kubernetes 环境部署,对运维能力要求较高,安装与升级涉及较多组件,投入前应评估团队的技术储备;资源配额与抢占策略的配置直接影响到各团队的训练稳定性,建议先在测试集群验证规则,长期运行的存储与电力成本也需纳入规划。

Polyaxon

Polyaxon

一个面向机器学习团队的平台工程方案,把实验跟踪、超参数调优、流水线编排与模型部署等环节统一到同一套系统中,支持在自有 Kubernetes 集群上运行,并提供任务队列与资源调度能力,便于把零散的训练脚本整理为可复用、可追溯的工作流。适合需要规范化模型研发流程的平台与算法团队。需要注意的是,该产品的部分关键能力面向企业版,社区版的组件覆盖范围有差异,选型时应先确认所需功能所处的版本;平台自建部署带来较高的运维投入,集群规模不大时收益有限,落地前应结合团队规模与研发流程做成本收益评估。

Invokeai

Invokeai

一款开源的图像生成创作引擎,围绕 Stable Diffusion 系列模型提供可视化操作界面,支持文生图、图生图、局部重绘与画布扩展等功能,并提供统一的模型管理、工作流与队列机制,可在本地或服务器上部署运行,便于团队集中管理生成资源。适合需要长期做图像生成实验的创作者与开发团队。需要注意的是,本地运行的生成速度与可用模型规模取决于显卡显存,建议先在目标硬件上测试再决定部署方案;生成图片的版权与可商用范围因所用模型而异,涉及人物形象与特定风格时应确认授权,生成内容中可能出现的偏差与不当元素需要人工筛选后再对外使用。

Kserve

Kserve

一个面向 Kubernetes 的开源模型推理平台,通过自定义资源把模型的部署、扩缩容、网络与健康检查等运维工作标准化,支持生成式与预测式两类模型,兼容主流机器学习框架以及多种高性能推理后端,提供金丝雀发布、模型集成与缩容到零等能力,帮助团队在自有集群上统一托管模型服务。适合已有 Kubernetes 基础设施、需要规模化部署模型的平台与算法团队。需要注意的是,落地需要团队具备一定的容器与集群运维能力,平台本身不解决模型效果与数据质量问题;GPU 资源与常驻实例会产生持续成本,建议结合调用量配置扩缩策略,多租户场景下的隔离与权限控制也需要额外规划。

Caffe2

Caffe2

开源

Caffe2 是 Facebook 开源的轻量级深度学习框架,强调模块化与移动端部署,曾是生产环境部署模型的常见选择。项目现已并入 PyTorch,官方不再单独维护,此处仅作为历史资料与旧系统维护的参考,新项目建议直接使用 PyTorch 生态。

Spiceai

Spiceai

开源

Spice 是一个用 Rust 编写的开源数据加速引擎,为 SQL 查询与大模型推理提供快速数据访问层,支持对接多种数据源并做缓存加速,适合需要给 AI 应用接实时数据、或优化分析查询性能的工程团队。部署形态灵活,可云端可本地,文档提供完整示例。

Flower

Flower

开源

Flower 是一个对开发者友好的联邦学习开源框架,支持把 PyTorch、TensorFlow 等主流框架的模型接入联邦训练,抽象清晰、示例丰富,适合做隐私保护分布式训练的研究与工程实验。文档完善、社区活跃,可先在单机模拟联邦流程再扩展到真实多节点。

Yayi2

Yayi2

开源

YAYI 2 是中科闻歌研发的新一代开源大语言模型,采用超过 2 万亿 Tokens 的高质量多语言语料预训练,权重以研究许可形式开放下载,配套给出模型卡片与使用说明。适合中文场景的研究与私有化部署实验,商用需确认许可条款,推理需要相应的算力资源。

Rig

Rig

开源

Rig 是一个用 Rust 编写的 LLM 应用开发库,提供模型调用、向量检索与 Agent 构建等模块化组件,强调类型安全与高性能,适合想在 Rust 技术栈里构建可扩展 LLM 应用的开发者。生态较新,组件仍在快速迭代,文档以仓库与示例为主。

本地部署1 个工具