R

MultiTalk

MultiTalk是由中山大学深圳校区、美团和香港科技大学联合推出的音频驱动多人对话视频生成框架。它根据多声道音频输入、参考图像和文本提示,生成包含人物互动且口型与音频一致的视频。通过Label Rotary Position Embedding (L-RoPE) 方法解决多声道音频与人物绑定问题,并采用部分参数训练和多任务训练策略,保留基础模型的指令跟随能力。MultiTalk适用于卡通、歌唱及

Vanna

Vanna 是一款开源的 Python RAG 框架,能够基于大型语言模型生成精确的 SQL 查询。它支持多类型数据库与 LLMs,采用检索增强生成技术提高查询准确性,同时保障数据安全。Vanna 还具备自定义前端界面和用户反馈机制,广泛适用于数据分析师、BI 工具、客户支持系统及数据科学项目等领域。

Remove.photos

一款免费的图片背景去除工具,能 00% 自动在3秒内去除图片背景。它不仅能一键生成透明背景图片,还能通过在线消除笔功能轻松移除图片上的多余物体。

Natural Language Playlist

Natural Language Playlist 探索语言和音乐之间丰富而复杂的关系,并使用 Transformer 语言模型构建播放列表。由于没有更好的术语,音乐推荐是一种“闭门造车”的东西。

CatVTON

CatVTON是一款基于先进AI算法的虚拟试衣工具,能够将服装从一个人无缝转移到另一个人身上,同时保留服装细节的一致性。该工具采用轻量级网络架构,减少了计算资源的需求,无需复杂的预处理步骤,即可实现高效的服装试穿效果。CatVTON适用于电子商务、时尚设计、个性化推荐等多个领域,为用户提供了便捷且真实感强的虚拟试衣体验。

Mistral AI

Mistral AI 推出了 Mistral 7B,这是一种突破性的 7.3B 参数语言模型,它的功能超越了许多大型模型,提供了增强的推理、理解和概括,同时高效且具有成本效益。

OptimizerAI

一个专门为视频自动生成音效的AI工具,可以为AI视频自动配音,能够通过文字提示创造出适用于各种场景的声音和音效。

Moonvy提示词可视化

这是一个旨在把 AIGC 提示词(现在支持 Midjourney和Stable Diffusion)可视化并提供编辑功能的工具,主要用于AI绘画领域

n8n

n8n是一款开源的自动化工作流管理系统,采用低代码平台设计,支持拖放式工作流创建,无需编程即可实现复杂业务流程的自动化。其核心功能包括工作流自动化、多应用集成、数据转换与错误处理,同时具备强大的调试和日志记录能力。n8n基于Docker容器化部署,支持事件驱动和数据流处理,广泛应用于数据集成、报告生成、客户支持自动化及社交媒体管理等多个领域。

Insert Anything

Insert Anything是由多所高校联合开发的图像插入框架,支持多种场景下的对象无缝融合,如艺术创作、虚拟试穿和影视特效等。基于大规模数据集训练,具备高分辨率输出与语义一致性保障。用户可通过掩码或文本指令实现精准控制,适用于创意设计与数字内容生成领域。