由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名
项目竞品项目
SemiAnalysisAI/InferenceX
开源持续推理基准测试:Qwen3.5、DeepSeek、GPTOSS - GB200 NVL72对比MI355X、B200、GB300 NVL72、H100,即将支持TPUv6e/v7/Trainium2/3
dusty-nv/jetson-containers
适用于NVIDIA Jetson和JetPack-L4T的机器学习容器
thu-ml/SageAttention
量化注意力机制相比FlashAttention和xformers实现了2-5倍和3-11倍的速度提升,且在语言、图像和视频模型上保持端到端指标无损。
flashinfer-ai/flashinfer
FlashInfer:大语言模型服务的核心计算库
NVIDIA/gpu-operator
NVIDIA GPU Operator可在Kubernetes中创建、配置和管理GPU
NVIDIA/cccl
CUDA核心计算库
rapidsai/cugraph
cuGraph - RAPIDS 图分析库
NVIDIA/cub
[已归档] CUDA C++协同原语 参见https://github.com/NVIDIA/cccl
NVIDIA/nvbench
CUDA内核基准测试库
JuliaGPU/AcceleratedKernels.jl
面向Julia CPU与GPU后端的跨架构并行算法。
NVIDIA/DeepStream
NVIDIA DeepStream Monorepo:DeepStream SDK及参考应用,用于构建基于GStreamer、TensorRT和视觉AI模型的GPU加速实时视频与多传感器分析管道,支持边缘、本地及云端部署。
iree-org/iree
一个基于MLIR的可重定向机器学习编译器与运行时工具包。
NVIDIA/warp
一个用于加速仿真、数据生成和空间计算的 Python 框架。
NVIDIA/nccl
面向集体多GPU通信的优化原语
vllm-project/vllm
面向大语言模型的高吞吐量与内存优化型推理服务引擎
tracel-ai/burn
Burn是下一代深度学习框架,在灵活性、效率和可移植性方面毫不妥协。
isl-org/Open3D
Open3D:面向三维数据处理的现代算法库
LMCache/LMCache
通过最快的KV缓存层为您的LLM加速
NVIDIA/cutlass
线性代数子程序的CUDA模板
相关项目推荐
jackfrued/Python-100-Days
Python - 100天从新手到大师
microsoft/generative-ai-for-beginners
21堂课带你入门生成式AI开发
rasbt/LLMs-from-scratch
使用PyTorch从零开始逐步实现类ChatGPT大型语言模型
microsoft/ML-For-Beginners
12周、26节课、52个测验,面向所有人的经典机器学习课程
openai/openai-cookbook
OpenAI API 使用示例与指南
CompVis/stable-diffusion
潜在文本到图像扩散模型