由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名
项目竞品项目
NVIDIA/cub
[已归档] CUDA C++协同原语 参见https://github.com/NVIDIA/cccl
flashinfer-ai/flashinfer
FlashInfer:大语言模型服务的核心计算库
NVIDIA/CUDALibrarySamples
CUDA库示例集
rapidsai/cugraph
cuGraph - RAPIDS 图分析库
CannyLab/tsne-cuda
支持Python绑定的CUDA加速t-SNE实现
NVIDIA/warp
一个用于加速仿真、数据生成和空间计算的 Python 框架。
NVlabs/cuda-oxide
cuda-oxy 是一个 Rust 到 CUDA 的编译器,可让您使用安全(ish)、惯用的 Rust 编写(SIMT)GPU 内核。它将标准 Rust 代码直接编译为 PTX——没有 DSL,没有外语绑定,只有 Rust。
diku-dk/futhark
💥💻💥 一种数据并行的函数式编程语言
NVIDIA/gpu-operator
NVIDIA GPU Operator可在Kubernetes中创建、配置和管理GPU
NVIDIA/cccl
CUDA核心计算库
tenstorrent/tt-metal
🤘 TT-NN算子库与TT-Metalium底层内核编程模型
Zaneham/BarraCUDA
面向多GPU架构的开源CUDA编译器,可将.cu文件编译至AMD与Tenstorrent GPU平台
cupy/cupy
面向GPU的NumPy与SciPy
NVIDIA/cutlass
线性代数子程序的CUDA模板
catboost/catboost
一个快速、可扩展、高性能的基于决策树的梯度提升库,用于Python、R、Java、C++的排序、分类、回归及其他机器学习任务,支持CPU和GPU计算。
isl-org/Open3D
Open3D:面向三维数据处理的现代算法库
相关项目推荐
karpathy/llm.c
基于纯C/CUDA的简易大语言模型训练
NVlabs/instant-ngp
即时神经图形原语:极速神经辐射场(NeRF)及其他技术
xlite-dev/LeetCUDA
📚LeetCUDA:面向初学者的现代CUDA学习笔记(基于PyTorch)🐑,包含200+个CUDA内核、张量核心、HGEMM、FA-2 MMA。🎉
HigherOrderCO/HVM2
一个基于Rust的大规模并行、最优函数运行时
deepseek-ai/DeepEP
DeepEP:高效的专家并行通信库
deepseek-ai/DeepGEMM
DeepGEMM:具备细粒度缩放功能的精简高效FP8通用矩阵乘内核