由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名
项目竞品项目
thu-ml/SageAttention
量化注意力机制相比FlashAttention和xformers实现了2-5倍和3-11倍的速度提升,且在语言、图像和视频模型上保持端到端指标无损。
rapidsai/cugraph
cuGraph - RAPIDS 图分析库
NVIDIA/cub
[已归档] CUDA C++协同原语 参见https://github.com/NVIDIA/cccl
NVIDIA/nvbench
CUDA内核基准测试库
kserve/kserve
面向 Kubernetes 可扩展多框架部署的标准化分布式生成式与预测式 AI 推理平台
SemiAnalysisAI/InferenceX
开源持续推理基准测试:Qwen3.5、DeepSeek、GPTOSS - GB200 NVL72对比MI355X、B200、GB300 NVL72、H100,即将支持TPUv6e/v7/Trainium2/3
sgl-project/sglang
SGLang是面向大语言模型与视觉语言模型的高速推理框架。
NVIDIA/TensorRT-LLM
TensorRT LLM provides users with an easy-to-use Python API to define Large Language Models (LLMs) and supports state-of-the-art optimizations to perform inference efficiently on NVIDIA GPUs. TensorRT LLM also contains components to create Python and C++ runtimes that orchestrate the inference execution in a performant way.
isl-org/Open3D
Open3D:面向三维数据处理的现代算法库
lemonade-sdk/lemonade
Lemonade 通过直接在用户自己的 GPU 和 NPU 上运行优化后的 LLM,帮助用户发现并运行本地 AI 应用。加入我们的 Discord:https://discord.gg/5xXzkMu8Zk
dusty-nv/jetson-containers
适用于NVIDIA Jetson和JetPack-L4T的机器学习容器
llm-d/llm-d
llm-d 是基于 Kubernetes 的高性能分布式 LLM 推理框架
elixir-nx/nx
用于Elixir的多维数组(张量)与数值定义。
NVIDIA/cutlass
线性代数子程序的CUDA模板
NVIDIA/warp
一个用于加速仿真、数据生成和空间计算的 Python 框架。
NVlabs/cuda-oxide
cuda-oxy 是一个 Rust 到 CUDA 的编译器,可让您使用安全(ish)、惯用的 Rust 编写(SIMT)GPU 内核。它将标准 Rust 代码直接编译为 PTX——没有 DSL,没有外语绑定,只有 Rust。
NVIDIA/gpu-operator
NVIDIA GPU Operator可在Kubernetes中创建、配置和管理GPU
NVIDIA/cccl
CUDA核心计算库
tracel-ai/burn
Burn是下一代深度学习框架,在灵活性、效率和可移植性方面毫不妥协。
LMCache/LMCache
通过最快的KV缓存层为您的LLM加速
相关项目推荐
karpathy/llm.c
基于纯C/CUDA的简易大语言模型训练
NVlabs/instant-ngp
即时神经图形原语:极速神经辐射场(NeRF)及其他技术
xlite-dev/LeetCUDA
📚LeetCUDA:面向初学者的现代CUDA学习笔记(基于PyTorch)🐑,包含200+个CUDA内核、张量核心、HGEMM、FA-2 MMA。🎉
HigherOrderCO/HVM2
一个基于Rust的大规模并行、最优函数运行时
deepseek-ai/DeepEP
DeepEP:高效的专家并行通信库
deepseek-ai/DeepGEMM
DeepGEMM:具备细粒度缩放功能的精简高效FP8通用矩阵乘内核