由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名
项目竞品项目
NVIDIA/cccl
CUDA核心计算库
NVIDIA/nvbench
CUDA内核基准测试库
brucefan1983/GPUMD
图形处理器分子动力学
xlite-dev/LeetCUDA
📚LeetCUDA:面向初学者的现代CUDA学习笔记(基于PyTorch)🐑,包含200+个CUDA内核、张量核心、HGEMM、FA-2 MMA。🎉
AccelerateHS/accelerate
用于高性能数组计算的嵌入式语言
taskflow/taskflow
基于现代C++的通用任务并行编程系统
OpenNMT/CTranslate2
面向Transformer模型的快速推理引擎
thu-ml/SageAttention
量化注意力机制相比FlashAttention和xformers实现了2-5倍和3-11倍的速度提升,且在语言、图像和视频模型上保持端到端指标无损。
NVIDIA/cuda-samples
面向CUDA开发者的示例代码库,展示CUDA工具包功能特性
flashinfer-ai/flashinfer
FlashInfer:大语言模型服务的核心计算库
cupy/cupy
面向GPU的NumPy与SciPy
相关项目推荐
karpathy/llm.c
基于纯C/CUDA的简易大语言模型训练
NVlabs/instant-ngp
即时神经图形原语:极速神经辐射场(NeRF)及其他技术
xlite-dev/LeetCUDA
📚LeetCUDA:面向初学者的现代CUDA学习笔记(基于PyTorch)🐑,包含200+个CUDA内核、张量核心、HGEMM、FA-2 MMA。🎉
HigherOrderCO/HVM2
一个基于Rust的大规模并行、最优函数运行时
deepseek-ai/DeepEP
DeepEP:高效的专家并行通信库
deepseek-ai/DeepGEMM
DeepGEMM:具备细粒度缩放功能的精简高效FP8通用矩阵乘内核