由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名
项目竞品项目
SemiAnalysisAI/InferenceX
开源持续推理基准测试:Qwen3.5、DeepSeek、GPTOSS - GB200 NVL72对比MI355X、B200、GB300 NVL72、H100,即将支持TPUv6e/v7/Trainium2/3
unilabsim/UniLab
UniLab:一种超越GPU主导范式的机器人强化学习异构架构
JuliaGPU/AcceleratedKernels.jl
面向Julia CPU与GPU后端的跨架构并行算法。
iree-org/iree
一个基于MLIR的可重定向机器学习编译器与运行时工具包。
tracel-ai/burn
Burn是下一代深度学习框架,在灵活性、效率和可移植性方面毫不妥协。
cupy/cupy
面向GPU的NumPy与SciPy
LMCache/LMCache
通过最快的KV缓存层为您的LLM加速
相关项目推荐
karpathy/llm.c
基于纯C/CUDA的简易大语言模型训练
NVlabs/instant-ngp
即时神经图形原语:极速神经辐射场(NeRF)及其他技术
xlite-dev/LeetCUDA
📚LeetCUDA:面向初学者的现代CUDA学习笔记(基于PyTorch)🐑,包含200+个CUDA内核、张量核心、HGEMM、FA-2 MMA。🎉
HigherOrderCO/HVM2
一个基于Rust的大规模并行、最优函数运行时
deepseek-ai/DeepEP
DeepEP:高效的专家并行通信库
deepseek-ai/DeepGEMM
DeepGEMM:具备细粒度缩放功能的精简高效FP8通用矩阵乘内核