AI

ICEdit

ICEdit是由浙江大学与哈佛大学联合开发的指令式图像编辑框架,基于扩散变换器实现自然语言驱动的图像修改。支持多轮编辑、风格转换、对象替换等功能,具有高效处理能力(单张图像约9秒)。采用LoRA-MoE混合微调策略,降低资源需求,适用于创意设计、影视制作、社交媒体等多个领域。开源且提供在线体验,便于研究与应用。

MM

MM-StoryAgent是由上海交通大学X-LANCE实验室与阿里巴巴集团联合开发的开源多模态、多智能体框架,用于生成沉浸式有声故事绘本视频。它结合大型语言模型与多模态生成技术,通过多阶段写作流程和模态对齐优化,提升故事内容的质量与连贯性。支持灵活模块化设计,适用于儿童教育、数字内容创作、在线教育等多个场景,为故事创作提供高效、可定制的解决方案。

MHA2MLA

MHA2MLA是一种由多所高校与研究机构联合开发的数据高效微调方法,基于多头潜在注意力机制(MLA)优化Transformer模型的推理效率。通过Partial-RoPE和低秩近似技术,显著减少KV缓存内存占用,同时保持模型性能稳定。仅需少量数据即可完成微调,适用于边缘设备、长文本处理及模型迁移等场景,具备高兼容性和低资源消耗优势。

JoinMC

JoinMC是一款针对跨境营销设计的AI工具,集成了社交媒体、邮件、电商和物流四个关键渠道,具备全天候智能客服、多语言翻译、负面评论管理、物流追踪、产品推荐及数据分析等功能。它通过专属知识库和场景识别技术,帮助企业提升品牌形象、优化客户服务体验,并有效降低运营成本。

backseat ai

Backseat AI是一款面向《英雄联盟》玩家的AI语音辅助工具,提供实时游戏评论、购买建议、对线策略以及赛后分析等功能。它具有低资源占用、多语言支持和个性化语音包的特点,并与创作者共享收益,支持内容创作发展。

WebSSL

WebSSL是由Meta和纽约大学等机构开发的视觉自监督学习模型,基于大规模网络图像数据训练,无需语言监督即可学习有效视觉表示。其包含多个变体,参数规模从3亿到70亿不等,在多模态任务如视觉问答、OCR和图表理解中表现出色。通过筛选含文本图像数据,显著提升特定任务性能。模型具备良好的扩展性,适用于智能客服、文档处理、医疗影像分析等多个领域。

brain.fm

Brain.fm是一款基于科学研究设计的音频工具,通过定制化音乐帮助用户提升专注力、缓解压力并改善睡眠质量。它包含专注、放松和助眠三大核心功能模块,提供多样化的音频选择,并允许用户根据需求调整音频强度。其背后的研究支持和个性化体验使其成为多功能的生活辅助应用。

Bocha Semantic Reranker

Bocha Semantic Reranker是一款基于语义的排序模型,用于提升搜索和问答系统的准确性。它通过二次优化初步排序结果,评估查询与文档的语义相关性,并为文档分配语义得分。该工具支持多种语言模型,适用于搜索引擎优化、问答系统、推荐系统和智能客服等领域,旨在改善用户体验并提高系统效率。

AI速搭

AI速搭是百度智能云推出的低代码开发平台,支持可视化操作,无需编程即可快速构建智能应用。集成文心一言、人脸识别、OCR等AI能力,提供数据管理、API对接、流程控制等功能,适用于内容创作、智能客服、数据分析等多种场景,提升开发效率与智能化水平。

纳米搜索

纳米搜索是一款由360集团开发的多功能AI搜索引擎,支持文字、语音、拍照和视频等多种搜索方式,涵盖从简单到复杂的全方位解答方案。它整合了16款顶尖大模型能力,配备了智能工具,如写作、翻译和旅游规划助手,旨在提升多场景下的操作效率。此外,其独特的AI脱口秀功能,能将搜索结果转化为视频内容,为用户提供更直观的知识获取体验。