由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名
项目介绍
使用单张4GB GPU实现AirLLM 70B推理
AirLLM 70B inference with single 4GB GPU
智能解读
AirLLM大幅降低大模型推理内存占用,让70B参数模型可运行在单张4GB GPU上,无需量化、蒸馏或剪枝。通过稀疏MoE逐专家流式加载机制,还能运行405B Llama 3.1、DeepSeek-V3(671B)甚至2.8T参数的Kimi K3模型,显存占用分别仅需8GB、12GB和不到4GB。支持FP8量化及Qwen3、Llama等主流开源模型,适合资源有限的个人开发者进行大模型推理和微调实验。
原始标签
智能标签
使用场景
项目健康度
距上次更新 8 天
平台 Star TOP 2% · Forks 3,059
本周 +1,588 ⭐ · 本月 +3,621 ⭐
9 位贡献者 · 0 条平台评论
缺少 1 项内容
项目信息
赞赏支持
如果本站对你有帮助,欢迎打赏支持
微信
支付宝
Widget 徽章
相关项目推荐
jackfrued/Python-100-Days
Python - 100天从新手到大师
microsoft/generative-ai-for-beginners
21堂课带你入门生成式AI开发
rasbt/LLMs-from-scratch
使用PyTorch从零开始逐步实现类ChatGPT大型语言模型
microsoft/ML-For-Beginners
12周、26节课、52个测验,面向所有人的经典机器学习课程
openai/openai-cookbook
OpenAI API 使用示例与指南
CompVis/stable-diffusion
潜在文本到图像扩散模型
加载评论中...