由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名

multimodal

话题找到数量

Mintplex-Labs/anything-llm

内置RAG、AI智能体、无代码智能体构建器、MCP兼容等功能的桌面与Docker一体化AI应用

66k
7.3k
1.6k
+205
排名 #14
9月17日
查看详情

bytedance/UI-TARS-desktop

开源多模态AI智能体堆栈,连接尖端AI模型与智能体基础设施

36k
3.7k
1.5k
+49
排名 #21
6月20日
查看详情

screenpipe/screenpipe

screenpipe将您的电脑转变为个人AI助手,它能知晓您的一切操作。记录、搜索、自动化,全部本地运行,完全私密,尽在您掌控。

20k
2.1k
1.1k
+33
排名 #12
8月10日
查看详情

duixcom/Duix-Avatar

🚀 真正开源的 AI 数字人工具包,支持离线视频生成与数字人克隆

15k
2.6k
995
+423
排名 #9
9月16日
查看详情

modelscope/ms-swift

使用PEFT或全参数方法对500余个大语言模型和200余个多模态大语言模型进行CPT/SFT/DPO/GRPO训练

14k
1.5k
1.5k
+11
排名 #12
6月12日
查看详情

rerun-io/rerun

可视化多模态数据流。免费、快速、易用且易于集成。基于Rust构建。

11k
816
1.2k
+10
排名 #15
8月4日
查看详情

datawhalechina/all-in-rag

🔍大模型应用开发实战一:RAG技术全栈指南,在线阅读地址:https://datawhalechina.github.io/all-in-rag/

9.3k
4.6k
892
+37
排名 #13
7月7日
查看详情

AI4Finance-Foundation/FinRobot

FinRobot:基于大语言模型的金融分析开源AI智能体平台🚀 🚀 🚀

8k
1.4k
1k
+12
排名 #19
9月16日
查看详情

Blaizzy/mlx-audio

基于 Apple MLX 框架构建的文本转语音 (TTS)、语音转文本 (STT) 和语音转语音 (STS) 库,可在 Apple Silicon 上提供高效的语音分析。

7.8k
689
1.1k
+12
排名 #15
8月17日
查看详情

HenryNdubuaku/maths-cs-ai-compendium

成为顶尖的人工智能与机器学习研究工程师

6.9k
825
957
+381
排名 #7
7月18日
查看详情

genkit-ai/genkit

用于在JavaScript、Go和Python中构建AI驱动的应用程序的开源框架,由Google构建并在生产环境中使用

6.4k
837
802
+4
排名 #14
8月26日
查看详情

OpenBMB/UltraRAG

UltraRAG v3:一个用于构建复杂创新RAG管道的低代码MCP框架

5.4k
387
1k
+13
排名 #10
3月3日
查看详情

vllm-project/vllm-omni

一个面向全模态模型的高效推理框架。

5.1k
1.1k
1.4k
+24
排名 #15
6月10日
查看详情

microsoft/PhiCookBook

这是一本 Phi 系列 SLM 书籍,用于入门 Phi 模型。 Phi 是微软开发的一系列开源人工智能模型。 Phi 模型是现有功能最强大、最具成本效益的小语言模型 (SLM),在各种语言、推理、编码和数学基准测试中,其性能优于相同大小和更高大小的模型

3.9k
521
397
+17
排名 #16
9月6日
查看详情

vortex-data/vortex

可扩展的尖端列式文件格式。原属@spiraldb项目,现为Linux基金会托管项目

3k
169
1.1k
+21
排名 #12
6月14日
查看详情

liustack/modlens

DeepSeek Harness 的第一个视觉插件,以及每个纯文本编码代理的视觉桥。粘贴图像,获取结构化 JSON 证据(OCR、布局、语义)。 | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得格式化 JSON 证据(OCR、版面、语义)。

2.8k
76
552
+441
排名 #4
8月17日
查看详情

OpenMOSS/MOSS-TTS

MOSS‑TTS 系列是由 MOSI.AI 与 OpenMOSS 团队开发的开源语音与声音生成模型系列。

2.8k
247
884
+904
排名 #21
5月31日
查看详情

Tencent-Hunyuan/HunyuanImage-3.0

HunyuanImage-3.0:一个强大的原生多模态图像生成模型

2.8k
137
821
+9
排名 #10
1月30日
查看详情

fikrikarim/parlor

设备端实时多模态AI。与完全运行在您本机上的AI进行自然的语音和视觉对话,由Gemma 4 E2B和Kokoro驱动。

1.9k
232
721
+3
排名 #9
7月4日
查看详情

NVIDIA-NeMo/DataDesigner

🎨 NeMo数据设计器:从零开始或基于种子数据生成高质量合成数据

1.5k
132
955
+244
排名 #9
4月7日
查看详情

jordanrendric/claude-video-vision

让 Claude 能够观看和理解视频 — 具有帧提取和多模态音频分析功能的 Claude Code 插件

1.2k
141
478
+25
排名 #11
8月8日
查看详情

sgl-project/sglang-omni

SGLang-Omni 为 TTS、ASR、语音和全向模型提供高性能服务。

819
341
494
+12
排名 #10
8月15日
查看详情

yashab-cyber/opendroid

您的开放式自治 Android 代理 — 一款可投入生产、自我规划的 AI 助手,由本地/远程 LLM 和可访问性驱动的屏幕自动化提供支持。

625
87
428
+9
排名 #16
8月14日
查看详情

antflydb/antfly

暂无项目描述

425
26
773
排名 #5
8月26日
查看详情
助手