多模态 - 智狐AI导航

VITA

VITA-Audio 是一款开源的端到端多模态语音大模型，具备低延迟、高推理效率和多模态交互能力。其核心创新包括轻量级 MCTP 模块和四阶段渐进式训练策略，使模型在语音识别、文本转语音和口语问答等任务中表现优异。支持实时对话、智能客服、教育辅助、医疗辅助及内容创作等多种应用场景，适用于各类语音交互系统。

AI项目与工具 2025年06月11日 19 点赞 0 评论 915 浏览

PixVerse V3

PixVerse V3是一款由爱诗科技开发的AI视频生成工具，具备创意模板、口型匹配、风格转换等多模态生成能力。其核心功能包括精准的提示词理解、高质量视频生成、多种视频比例支持以及风格化功能升级。新增的口型适配功能和8个创意效果模板进一步丰富了应用场景，适用于社交媒体、广告营销、教育、影视及游戏开发等领域。

AI项目与工具 2025年06月12日 79 点赞 0 评论 912 浏览

飞猪AI问一问

飞猪AI问一问是一款基于多智能体协作的AI旅行助手，可快速生成包含机票、酒店、景点路线的完整旅行方案，并支持预算调节和实时信息同步。用户可通过文字、语音或方言交互，系统根据实时位置推荐周边服务，适合多种旅行场景，提供个性化、便捷的旅行规划体验。

AI项目与工具 2025年04月23日 79 点赞 0 评论 911 浏览

Reel.AI

Reel.AI是一款利用AI技术生成短视频内容的应用程序，支持文本、图片等多种输入形式，生成高质量的短剧和视频内容。其核心功能包括文本到视频转换、多模态内容生成、情感共鸣驱动的短剧创作及交互式体验设计。Reel.AI基于自主研发的Reel Diffusion模型，广泛应用于娱乐消费、内容创作、广告营销及教育等领域。

AI项目与工具 2025年06月12日 84 点赞 0 评论 907 浏览

MME

MME-CoT 是一个用于评估大型多模态模型链式思维推理能力的基准测试框架，涵盖数学、科学、OCR、逻辑、时空和一般场景六大领域，包含1,130个问题，每题均附关键推理步骤和图像描述。该框架引入推理质量、鲁棒性和效率三大评估指标，全面衡量模型推理能力，并揭示当前模型在反思机制和感知任务上的不足，为模型优化和研究提供重要参考。

AI项目与工具 2025年06月12日 36 点赞 0 评论 906 浏览

LobeChat

一个开源、高性能的聊天机器人框架，支持语音合成、多模态和可扩展（函数调用）插件系统。支持一键免费部署您的私人 ChatGPT/LLM Web 应用程序。

AI写作对话 2025年06月05日 37 点赞 0 评论 906 浏览

Gemini Robotics

Gemini Robotics 是谷歌 DeepMind 基于 Gemini 2.0 开发的机器人系统，融合视觉-语言-动作模型，支持复杂任务执行与环境适应。具备三维空间理解、物体检测、轨迹预测和开放词汇指令执行能力，适用于工业制造、物流仓储、家庭服务、医疗健康等多个领域。系统通过数据驱动训练，结合真实操作与多模态信息，实现高效、灵活的机器人控制。

AI项目与工具 2025年06月12日 17 点赞 0 评论 897 浏览

悦灵犀AI

悦灵犀AI是一款基于先进AI技术的创作平台，支持文生图、文生视频、背景替换、证件照生成及照片修复等多种功能。其智能助手和丰富工具使用户能够高效创作艺术作品，并广泛应用于艺术设计、广告营销、教育等领域。

AI项目与工具 2025年06月12日 51 点赞 0 评论 893 浏览

MiniMax MCP Server

MiniMax MCP Server 是一款基于 MCP 协议的多模态生成服务器，支持视频、图像、语音及声音克隆等功能。其具备高分辨率输出、自然语音生成与声音克隆能力，兼容多种主流客户端。平台采用客户端-服务器架构，结合 RAG 技术提升响应准确性，适用于教学、游戏开发、内容创作等多个领域。

AI项目与工具 2025年06月11日 14 点赞 0 评论 892 浏览

OThink

OThink-MR1是由OPPO研究院与香港科技大学（广州）联合研发的多模态语言模型优化框架，基于动态KL散度策略（GRPO-D）和奖励模型，提升模型在视觉计数、几何推理等任务中的泛化与推理能力。其具备跨任务迁移能力和动态平衡探索与利用机制，适用于智能视觉问答、图像描述生成、内容审核等多个领域，具有广阔的应用前景。

AI项目与工具 2025年06月12日 21 点赞 0 评论 891 浏览

多模态

首页

多模态

列表

默认

浏览次数

发布日期