由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名

EricLBuehler

EricLBuehler/mistral.rs

Rust 一般
426
2026-06-30
7.4k
+232
#19
640

项目介绍

快速灵活的LLM推理

Fast, flexible LLM inference

智能解读

智能解读 自动生成

Mistral.rs 是一个用 Rust 编写的高性能 LLM 推理引擎,专为快速、灵活地运行大型语言模型而设计。它提供 Rust SDK 和 Python SDK,支持 OpenAI 兼容的 API 接口,并新增了 Anthropic 消息 API,方便集成到现有应用中。主要价值在于其卓越的推理速度:通过 CUDA 优化、FlashInfer 分页内核和 MoE 优化,在 GB10、B200 和 H100 SXM 等硬件上,其 UQFF Q8 格式的预填和解码吞吐量显著优于 llama.cpp,BF16 精度下也与 vLLM 持平。此外,它支持多模态模型(如 Gemma 4 处理文本、图像、视频和音频)、MXFP4 量化以减小模型体积,并内置了代理运行时,可实现网页搜索、本地 Python 代码执行和自定义工具钩子。适用于需要低延迟、高吞吐量推理的生产环境,以及构建智能体应用的开发者。

智能标签

使用场景

使用场景 自动生成

mistral.rs最适合需要低延迟、高吞吐量、多模态支持或智能体能力的生产级LLM推理场景,尤其适合在NVIDIA GPU上部署Gemma等模型。

1

低延迟生产推理

在GB10、B200等硬件上部署LLM时,llama.cpp的预填和解码吞吐量不足,无法满足实时响应需求。

利用mistral.rs的CUDA优化、FlashInfer分页内核和MoE优化,在Q8精度下预填TPS比llama.cpp高近2倍,解码TPS也显著领先,实现更低延迟。

在GB10上运行Gemma 4 E4B,预填TPS从3973.7提升至7395.7,解码TPS从40.5提升至44.1。

2

多模态智能应用

需要同时处理文本、图像、视频和音频输入,但现有推理引擎通常只支持单一模态,集成多个模型成本高。

mistral.rs原生支持Gemma 4等多模态模型,一个引擎即可处理文本、图像、视频和音频,无需额外组件。

构建一个智能客服系统,用户上传图片或视频片段,模型能理解内容并生成文本回复。

3

自主代理运行时

开发LLM驱动的智能体时,需要集成网页搜索、代码执行、自定义工具等能力,但缺乏统一的运行时支持。

mistral.rs内置代理运行时,支持网页搜索、本地Python代码执行和自定义工具钩子,可直接在推理流程中调用。

创建一个代码助手,用户提问后模型自动搜索文档、运行Python代码验证结果,并返回最终答案。

4

模型体积优化部署

在资源受限设备上部署大模型时,模型体积过大导致加载慢、显存不足,且量化后精度损失不可控。

使用MXFP4 ISQ量化,通过优化的解码内核在减小模型体积的同时保持较高精度,支持自动选择最佳量化格式。

在边缘设备上部署Gemma 4 26B-A4B,通过MXFP4量化将模型体积减半,推理速度仍可接受。

项目健康度

B
68/100
良好
活跃度人气增长社区文档
活跃度 10/23

距上次更新 38 天

人气 24/25

平台 Star TOP 7% · Forks 640

增长 13/25

本周 +44 ⭐ · 本月 +232 ⭐

社区 11/17

70 位贡献者 · 0 条平台评论

文档 10/10

文档资料完整

在 GitHub 上查看

项目信息

作者 EricLBuehler
来源 GitHub
周期 每月
仓库ID EricLBuehler/mistral.rs
最新提交 2026-06-28 20:02:05
第一收录 2026-07-01 10:01:44
最后更新 2026-07-01 10:01:44

赞赏支持

如果本站对你有帮助,欢迎打赏支持

微信打赏码

微信

支付宝打赏码

支付宝

评论 0

登录 后发表评论

加载评论中...

助手