由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名
vision-transformer
话题找到数量
huggingface/pytorch-image-models
规模最大的PyTorch图像编码器/骨干网络集合。包含训练、评估、推理、导出脚本与预训练权重——支持ResNet、ResNeXT、EfficientNet、NFNet、Vision Transformer(ViT)、MobileNetV4、MobileNet-V3和V2、RegNet、DPN、CSPNet、Swin Transformer、MaxViT、CoAtNet、ConvNeXt等模型
NielsRogge/Transformers-Tutorials
本仓库包含使用HuggingFace Transformers库构建的演示案例
adithya-s-k/omniparse
摄取、解析并优化任意数据格式 ➡️ 从文档到多媒体 ➡️ 以增强与GenAI框架的兼容性
liustack/modlens
DeepSeek Harness 的第一个视觉插件,以及每个纯文本编码代理的视觉桥。粘贴图像,获取结构化 JSON 证据(OCR、布局、语义)。 | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得格式化 JSON 证据(OCR、版面、语义)。