VideoCaptioner VideoCaptioner是一款基于大语言模型的智能字幕处理工具,支持语音识别、字幕优化、翻译、样式调整及视频合成等功能。无需GPU即可运行,兼容多语言和多种字幕格式,适用于视频创作者、教育工作者及字幕翻译团队,提升字幕制作效率与质量。 AI项目与工具 2025年06月12日 50 点赞 0 评论 620 浏览
可灵AI国际版(Kling AI) Kling AI国际版是快手推出的AI创意工具,支持图像、视频及声音的生成与编辑。用户可通过文本或图像输入生成内容,并利用AI模板、虚拟模特、换装及对口型等功能进行创作。适用于内容创作、教育、电商及社交等多个领域,提升创作效率与表现力。 AI项目与工具 2025年06月12日 79 点赞 0 评论 620 浏览
MetaMorph MetaMorph是一款基于多模态大模型的工具,通过Visual-Predictive Instruction Tuning(VPiT)技术实现文本和视觉token的生成。它在视觉理解和生成领域表现优异,能够克服其他生成模型的常见失败模式,同时有效处理专业术语和复杂语义问题。MetaMorph展示了统一建模方法的优势,支持多模态数据的高效处理,并在视觉生成与理解基准测试中取得竞争力表现。 AI项目与工具 2025年06月12日 53 点赞 0 评论 620 浏览
VideoRefer VideoRefer是由浙江大学与阿里达摩院联合开发的视频对象感知与推理系统,基于增强型视频大型语言模型,实现对视频中对象的细粒度理解与分析。其核心包括大规模视频数据集、多功能空间-时间编码器和全面评估基准,支持对象识别、关系分析、推理预测及多模态交互等功能,适用于视频剪辑、教育、安防、机器人控制和电商等多个领域。 AI项目与工具 2025年06月12日 19 点赞 0 评论 620 浏览
FunAudioLLM FunAudioLLM是由阿里巴巴通义实验室开发的开源语音大模型项目,包含SenseVoice和CosyVoice两个子模型。SenseVoice擅长多语言语音识别和情感辨识,支持超过50种语言;CosyVoice则专注于自然语音生成,支持多种语言、音色和情感控制。该项目适用于多语言翻译、情感语音对话等场景,其相关模型和代码已公开发布。 AI项目与工具 2025年06月12日 66 点赞 0 评论 620 浏览
InstructMove InstructMove是由东京大学与Adobe合作开发的图像编辑模型,基于视频帧对变化学习如何根据指令进行图像操作。它能够执行非刚性编辑、视角调整和元素重排等任务,同时支持精确的局部编辑。该模型采用真实视频数据训练,提升编辑自然性与真实性,适用于影视、广告、设计等多个领域。其技术基于多模态语言模型和扩散模型,结合掩码和ControlNet等控制机制,实现灵活高效的图像编辑。 AI项目与工具 2025年06月12日 21 点赞 0 评论 620 浏览
SOCIALDUDE SOCIALDUDE是一款基于AI技术的社交媒体内容创作平台,具备AI驱动的内容生成、品牌一致性维护及多平台适配等功能。它能够快速生成多样化的内容形式,如推文、视频脚本等,并支持用户根据目标受众需求定制个性化内容。此外,该平台还适用于品牌营销、个人品牌建设、小型企业运营等多个场景,旨在提升内容创作效率与传播效果。 AI项目与工具 2025年06月12日 66 点赞 0 评论 620 浏览
匡优Excel 匡优Excel是一款基于自然语言交互的智能数据分析工具,支持多种Excel文件格式,可自动生成可视化图表并提供数据分析报告。用户可通过简单指令完成数据处理、趋势分析及商业洞察,适用于销售、财务、库存管理等多个领域,操作便捷且安全可靠。 AI项目与工具 2025年06月12日 82 点赞 0 评论 620 浏览
k1.5 k1.5 是月之暗面推出的多模态思考模型,具备强大的数学、代码、视觉推理能力。在 short-CoT 模式下,性能超越主流模型 550%,在 long-CoT 模式下达到 OpenAI o1 水平。支持文本与图像的联合处理,适用于复杂推理、跨模态分析、教育、科研等领域。通过长上下文扩展和策略优化,提升推理效率与准确性。 AI项目与工具 2025年06月12日 38 点赞 0 评论 620 浏览
Eliza Eliza是一个基于TypeScript的开源多代理模拟框架,专为创建、部署和管理自主AI代理而设计。其主要功能涵盖多代理架构支持、角色文件框架、检索增强生成系统(RAG)、跨平台集成以及高度可扩展性。Eliza适用于聊天机器人、业务流程自动化、自主代理及游戏NPC等多种应用场景。 AI项目与工具 2025年06月12日 91 点赞 0 评论 620 浏览