由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名

cuda

话题找到数量

vllm-project/vllm

面向大语言模型的高吞吐量与内存优化型推理服务引擎

86k
19k
1k
+104
排名 #12
7月15日
查看详情

jamiepine/voicebox

开源语音合成工作室

49k
6k
489
+575
排名 #7
8月4日
查看详情

sgl-project/sglang

SGLang是面向大语言模型与视觉语言模型的高速推理框架。

30k
7.5k
990
+73
排名 #7
7月29日
查看详情

nagadomi/waifu2x

动漫风格图像超分辨率技术

28k
2.7k
593
+1
排名 #13
7月31日
查看详情

hashcat/hashcat

全球最快最先进的密码恢复工具

26k
3.5k
536
+74
排名 #13
7月26日
查看详情

NVlabs/instant-ngp

即时神经图形原语:极速神经辐射场(NeRF)及其他技术

17k
2.1k
636
+1
排名 #15
8月4日
查看详情

tracel-ai/burn

Burn是下一代深度学习框架,在灵活性、效率和可移植性方面毫不妥协。

15k
998
922
+18
排名 #15
7月29日
查看详情

vosen/ZLUDA

非NVIDIA GPU的CUDA支持

14k
915
420
+43
排名 #11
7月2日
查看详情

isl-org/Open3D

Open3D:面向三维数据处理的现代算法库

13k
2.6k
810
+6
排名 #7
6月11日
查看详情

srush/GPU-Puzzles

解谜题,学CUDA。

12k
933
283
+5
排名 #10
7月1日
查看详情

taskflow/taskflow

基于现代C++的通用任务并行编程系统

12k
1.4k
465
+4
排名 #13
7月22日
查看详情

cupy/cupy

面向GPU的NumPy与SciPy

12k
1.1k
427
+628
排名 #10
7月5日
查看详情

xlite-dev/LeetCUDA

📚LeetCUDA:面向初学者的现代CUDA学习笔记(基于PyTorch)🐑,包含200+个CUDA内核、张量核心、HGEMM、FA-2 MMA。🎉

11k
1.2k
174
+8
排名 #6
7月25日
查看详情

LMCache/LMCache

通过最快的KV缓存层为您的LLM加速

10k
1.5k
549
+101
排名 #9
7月10日
查看详情

NVIDIA/cutlass

线性代数子程序的CUDA模板

10k
2k
813
+6
排名 #10
8月1日
查看详情

NVIDIA/cuda-samples

面向CUDA开发者的示例代码库,展示CUDA工具包功能特性

9.4k
2.4k
498
+7
排名 #17
7月15日
查看详情

catboost/catboost

一个快速、可扩展、高性能的基于决策树的梯度提升库,用于Python、R、Java、C++的排序、分类、回归及其他机器学习任务,支持CPU和GPU计算。

9k
1.3k
276
+3
排名 #13
6月24日
查看详情

NVIDIA/warp

一个用于加速仿真、数据生成和空间计算的 Python 框架。

6.6k
509
573
+7
排名 #15
5月16日
查看详情

flashinfer-ai/flashinfer

FlashInfer:大语言模型服务的核心计算库

6k
1.2k
739
+5
排名 #8
7月24日
查看详情

shader-slang/slang

简化着色器开发流程

5.5k
475
742
+10
排名 #5
7月27日
查看详情

NVIDIA/nccl

面向集体多GPU通信的优化原语

4.7k
1.3k
533
+6
排名 #9
5月23日
查看详情

OpenNMT/CTranslate2

面向Transformer模型的快速推理引擎

4.5k
497
239
+3
排名 #5
6月27日
查看详情

iree-org/iree

一个基于MLIR的可重定向机器学习编译器与运行时工具包。

3.8k
939
850
+3
排名 #21
6月27日
查看详情

thu-ml/SageAttention

量化注意力机制相比FlashAttention和xformers实现了2-5倍和3-11倍的速度提升,且在语言、图像和视频模型上保持端到端指标无损。

3.6k
451
579
+27
排名 #2
8月4日
查看详情
助手