模型 - 智狐AI导航

Soundwave

Soundwave是由香港中文大学（深圳）开发的开源语音理解大模型，专注于语音与文本的智能对齐与处理。它采用对齐适配器和压缩适配器技术，提升语音特征压缩效率，支持语音翻译、语音问答、情绪识别及多模态交互等功能。适用于智能语音助手、语言学习、内容创作等多个领域，具有广泛的应用前景。

AI项目与工具 2025年06月12日 50 点赞 0 评论 687 浏览

琅琊

琅琊是中国科学院海洋研究所推出的一款海洋人工智能大模型，专注于全球海洋状态变量的中短期高精度预报。它采用先进的机器学习技术与海洋科学知识相结合的方式，提供1至7天的温度、盐度和海流等关键指标的高分辨率预报，显著提高海洋预报的准确性与可靠性。未来版本将扩展至更多复杂海洋现象的预测，增强灾害预警能力。 ---

AI项目与工具 2025年06月12日 12 点赞 0 评论 687 浏览

AutoConsis

AutoConsis是一款基于深度学习和大型语言模型的UI内容一致性智能检测工具，能够自动识别和提取界面中的关键数据，并对数据一致性进行高效校验。它支持多业务场景适配，具备高泛化性和高置信度，广泛应用于电商、金融、旅游等多个领域，助力提升用户体验和系统可靠性。

AI项目与工具 2025年06月12日 10 点赞 0 评论 686 浏览

Sa2VA

Sa2VA是由字节跳动联合多所高校开发的多模态大语言模型，结合SAM2与LLaVA技术，实现对图像和视频的密集、细粒度理解。它支持指代分割、视觉对话、视觉提示理解等多种任务，具备零样本推理能力和复杂场景下的高精度分割效果。适用于视频编辑、智能监控、机器人交互、内容创作及自动驾驶等多个领域。

AI项目与工具 2025年06月12日 66 点赞 0 评论 686 浏览

PikFlow

一款由人工智能驱动的让用户能够轻松生成和编辑图像的平台。PikFlow能够理解您的输入并生成图像，应用风格，去除背景，提高分辨率，甚至将2D图像转换为3D模型。

Ai绘画生成 2025年06月05日 90 点赞 0 评论 685 浏览

Phantom

Phantom是由字节跳动研发的视频生成框架，支持从参考图像中提取主体并生成符合文本描述的视频内容。它采用跨模态对齐技术，结合文本和图像提示，实现高质量、主体一致的视频生成。支持多主体交互、身份保留等功能，适用于虚拟试穿、数字人生成、广告制作等多种场景。模型基于文本-图像-视频三元组数据训练，具备强大的跨模态理解和生成能力。

AI项目与工具 2025年06月12日 72 点赞 0 评论 685 浏览