Matryoshka Diffusion Models Matryoshka Diffusion Models (MDM) 是一种由苹果公司开发的创新扩散模型,专为生成高分辨率图像和视频而设计。通过多尺度扩散机制与NestedUNet架构,MDM实现了高效的信息共享与渐进式训练,显著提升了模型的训练效率与生成质量。该模型适用于资源受限的环境,可减少训练步骤并保持生成图像的细节与清晰度。其主要功能包括高分辨率图像生成、多分辨率处理、特征共享以及渐进式训练 AI项目与工具 2025年06月12日 18 点赞 0 评论 816 浏览
AIMv2 AIMv2是苹果公司开发的开源多模态自回归预训练视觉模型,通过图像与文本的深度融合提升视觉理解能力。其采用图像块与子词标记拼接的方式进行自回归预训练,支持多种参数规模,适用于不同设备。具备视觉问答、指代表达理解、图像字幕生成、多媒体检索等功能,并可无缝集成到大型语言模型中。模型在多个视觉任务中表现优异,具备良好的可扩展性和零样本适应能力。 AI项目与工具 2025年06月12日 48 点赞 0 评论 816 浏览
Emotion Emotion-LLaMA是一款基于多模态输入的情绪识别与推理模型,结合音频、视觉和文本信息,提升情感理解的准确性与可解释性。模型采用改进版LLaMA架构,通过指令调整增强情感处理能力,并依托自建的MERR数据集进行训练与验证。在多个挑战赛中表现优异,适用于人机交互、教育、心理健康、客户服务等领域,具有广泛的应用前景。 AI项目与工具 2025年06月12日 85 点赞 0 评论 816 浏览
libcom libcom是一款由上海交通大学BCMI实验室开发的图像合成工具箱,支持图像融合、和谐化、阴影生成、对象放置及生成式合成等功能,采用传统图像处理与深度学习技术相结合的方式,提供高质量的合成图像解决方案。适用于增强现实、艺术创作、电子商务、影视制作及游戏开发等多个领域。 AI项目与工具 2025年06月12日 29 点赞 0 评论 816 浏览
Perception Perception-as-Control是由阿里巴巴通义实验室开发的图像动画框架,支持对相机和物体运动的细粒度控制。它基于3D感知运动表示,结合U-Net架构的扩散模型,实现多种运动相关的视频合成任务,如运动生成、运动克隆、转移和编辑。通过三阶段训练策略,提升运动控制精度和稳定性,适用于影视、游戏、VR/AR、广告及教育等多个领域。 AI项目与工具 2025年06月12日 20 点赞 0 评论 816 浏览
JoyAgent智能体平台 JoyAgent智能体平台是京东云推出的企业级一站式AI智能体搭建与发布平台,聚合大模型、知识库、插件和工作流等能力,支持低代码开发,用户可通过自然语言快速构建基于大语言模型的AI智能体。平台提供丰富的预置模板和工具,支持一键发布到微信、企业微信等主流IM和协同办公渠道,适用于智能客服、OA自动化、热点营销等场景,帮助企业提升业务效率和客户体验。 AI项目与工具 2025年06月11日 20 点赞 0 评论 817 浏览
智川X 智川X-Agent是中科闻歌推出的智能体开发平台,支持零代码构建AI应用,集成多种大模型,具备知识库管理、工作流编排、自定义插件等功能。适用于政务、金融、医疗、媒体等多个行业,帮助企业快速实现AI应用落地与持续优化。 AI项目与工具 2025年06月12日 47 点赞 0 评论 817 浏览
OmniHuman OmniHuman是字节跳动推出的多模态人类视频生成框架,基于单张图像和运动信号生成高逼真视频。支持音频、姿势及组合驱动,适用于多种图像比例和风格。采用混合训练策略和扩散变换器架构,提升生成效果与稳定性,广泛应用于影视、游戏、教育、广告等领域。 AI项目与工具 2025年06月12日 43 点赞 0 评论 817 浏览
美图AI视觉大模型 奇想智能MiracleVision大模型汇聚顶尖技术,专业人才和行业资源,依托美图视觉实验室的强大AI技术能力,通过美学升级锻造调优实现更懂美学的AI视觉大模型。 Ai平台模型 2025年06月05日 56 点赞 0 评论 817 浏览
EPLB EPLB是DeepSeek推出的专家并行负载均衡工具,用于优化大规模模型训练中的资源分配。它通过冗余专家策略和分层/全局负载均衡机制,提升GPU利用率和训练效率。支持多层MoE模型,减少通信开销,适应不同场景需求。 AI项目与工具 2025年06月12日 10 点赞 0 评论 818 浏览