虚拟

ImageBind

ImageBind是由Meta公司开发的开源多模态AI模型,能够整合文本、音频、视觉、温度和运动数据等多种模态的信息,并将其统一到一个嵌入空间中。该模型通过图像模态实现其他模态数据的隐式对齐,支持跨模态检索和零样本学习。它在增强现实(AR)、虚拟现实(VR)、内容推荐系统、自动标注和元数据生成等领域有广泛应用。

Character

Character-3 是 Hedra Studio 推出的全模态 AI 视频生成工具,支持图像、文本和音频输入,生成高质量动态视频。具备全身动作捕捉、情感控制、精准对口型等功能,适用于创意视频、虚拟形象、教育、营销等多个场景。采用多模态融合与先进 AI 技术,提升视频自然度与连贯性,提高内容创作效率。

MakeGirlsMoe

MakeGirlsMoe,开源的动漫角色图片生成工具,AI生成二次元美少女头像。

Digen AI

一种利用AI技术创建的克隆数字人,Digen AI人物形象模拟、人物声音克隆、自然语言处理、知识图谱解析等众多世界领先的人工智能技术,使得Digen AI可以随时随地与真人进行准确交互性对话。

Lookie

Lookie是一款基于AI技术的穿搭应用,用户可上传照片创建数字分身,试穿各类潮流服饰,并获取穿搭建议。它拥有丰富的服饰库,支持场景模拟及电商跳转功能,旨在提升用户日常与特殊场合的穿搭体验。

Tavus – AI视频生成平台,支持数字人克隆和实时对话

Tavus 是一个先进的 AI 视频生成平台,提供逼真的数字人克隆和实时对话式视频。基于 Phoenix-2 模型和对话式视频接口(CVI),Tavus 支持企业快速部署 AI 视频产品,提升用户体验并确保安全合规。主要功能包括 AI 视频生成、实时对话、开发者文档和工具,适用于客户服务、个性化营销、虚拟助手、教育和产品演示等多种应用场景。

Chinese

Chinese-LiPS是由智源研究院与南开大学联合开发的高质量中文多模态语音识别数据集,包含100小时语音、视频及手动转录文本。其创新性融合唇读视频与幻灯片内容,显著提升语音识别性能,实验表明可降低字符错误率约35%。适用于教学、科普、虚拟讲解等复杂语境,为多模态语音识别研究提供丰富数据支持。

Mobvoi MCP Server

Mobvoi MCP Server是出门问问推出的一站式AI工具,集成语音生成、声音克隆、图片驱动数字人、视频配音等多模态能力。用户可通过简单输入文本调用功能,支持多客户端和多场景应用。基于标准化接口和开源生态,提供高效、灵活的数字生产力解决方案,适用于内容创作、虚拟主播、在线教育等多个领域。

Pikadditions

Pikadditions是Pika推出的一项AI视频编辑工具,支持将图片无缝融入视频中,生成自然且引人入胜的效果。用户只需上传视频和图片,并输入简短提示,即可完成合成。功能操作简便,适用于创意视频制作、教育、影视、个人娱乐及企业宣传等多个领域,有效降低视频制作门槛和成本。

ProductScope

ProductScope是一款集AI产品摄影、亚马逊列表优化和客户洞察分析于一体的电商营销工具,专为品牌、设计师和营销人员打造。其核心功能涵盖高质量AI生成图片、关键词研究、背景移除、图像编辑与增强等,帮助企业高效优化产品展示,提升销售业绩。适用于电子商务品牌、数字营销机构及独立创作者,支持多场景应用。