视频

ACTalker

ACTalker 是一种基于视频扩散模型的端到端工具,可生成高质量、自然的说话人头部视频。支持多信号控制(如音频、表情),采用并行 Mamba 结构和门控机制,实现跨时间和空间的精准面部动作控制。实验表明其在音频同步性和视频质量上表现优异,适用于虚拟主播、远程会议、在线教育等多种场景。

AnimateAI.Pro

AnimateAI.Pro是一款基于先进AI技术的动画视频生成平台,支持用户通过简单操作快速生成高质量的连贯角色视频内容。平台集成了角色生成、故事板设计、视频制作及多种AI工具,用户无需专业背景即可高效创作动画视频,适用于教育、娱乐、影视等多个领域。

Kuaizi AI

一个专注于AI视频生成和内容商业化的平台,Kuaizi AI提供了从视频创意生成、剪辑到分发的全链路解决方案

VPP

VPP(Video Prediction Policy)是清华大学与星动纪元联合开发的AIGC机器人模型,基于视频扩散模型实现未来场景预测与动作生成。支持高频预测与跨机器人本体学习,显著降低对真实数据的依赖。在复杂任务中表现出色,适用于家庭、工业、医疗、教育等多个领域。其开源特性推动了具身智能机器人技术的发展。

Allavsoft

一款专业的视频下载和转换工具,Allavsoft支持从 YouTube、Spotify、Vimeo 等 10000 多个网站下载视频和音频。用户可以轻松下载高清视频、音乐视频、播放列表等,并将其转换为 MP4、MP3、AVI 等多种格式。

RecordScreen

一款不需要安装的浏览器在线屏幕录制工具,用户可以直接通过浏览器录制屏幕。它支持录制整个屏幕、浏览器窗口或特定标签页,并可选择同步录制摄像头画面。

SounDraw

SOUNDRAW是一个 A人工智能的音乐生成网站,它可以让所有的创作者自由地定制独特的、无版权的音乐。

phenaki

phenaki一种从文本生成视频的模型,提示可以随时间变化,视频可以长达数分钟。

YOLOv9

YOLOv9是一款先进的目标检测系统,由台北中研院和台北科技大学的研究团队开发。该系统在YOLO算法系列基础上进行了优化,引入了可编程梯度信息(PGI)和泛化高效层聚合网络(GELAN),显著提升了模型的准确性、参数效率、计算复杂度和推理速度。YOLOv9在多个应用场景中表现出色,包括视频监控、自动驾驶、机器人视觉和野生动物监测。

KeySync

KeySync是一种高分辨率口型同步工具,由帝国理工学院和弗罗茨瓦夫大学联合开发。其采用两阶段生成框架,结合掩码策略和视频分割模型,实现音频与唇部动作的精准对齐。支持高清视频生成,具备遮挡处理、减少表情泄露等功能,在视觉质量、时间连贯性和同步精度上优于现有方法,适用于自动配音、虚拟形象、视频会议等多场景应用。