Gemini 2.0 Gemini 2.0 是谷歌推出的原生多模态AI模型,具备快速处理文本、音频和图像的能力,支持多语言输出和实时音视频流输入。通过Agent技术和工具调用,Gemini 2.0 能够自主理解任务并提供解决方案,已在编程、数据分析、游戏等领域展示应用潜力。目前提供免费试用,计划逐步开放更多功能。 AI项目与工具 2025年06月12日 63 点赞 0 评论 146 浏览
Mobile Mobile-Agent 是一种具备移动能力的智能代理系统,能够跨设备执行任务并优化资源使用。基于多模态大语言模型和视觉感知技术,支持自动操作、自我规划与反思,适用于多应用协同、跨平台操作及纯视觉交互。其技术架构包含多个智能体协作机制,提升了移动设备任务处理的效率与灵活性。 AI项目与工具 2025年06月12日 18 点赞 0 评论 147 浏览
AsPoem 一个现代化的中国诗词学习网站,它收集了较多的文学诗词数据,用户可以通过作者、诗词、名句快速查找诗词并提供诗词原文及翻译,使得用户能够轻松地学习中国古诗词。 剧本文案 2025年06月05日 33 点赞 0 评论 147 浏览
加州理工学院 加州理工学院(California Institute of Technology,简称:Caltech),创立于1891年,位于美国加利福尼亚州洛杉矶东北郊的帕萨迪纳(Pasadena),私立研究型大学,全球大学校长论... 教育学习 1970年01月01日 0 点赞 0 评论 147 浏览
ArchitectGPT 一款创新的AI室内设计工具,旨在帮助您创建梦想空间的惊人视觉效果。凭借其尖端技术,ArchitectGPT 使您能够毫不费力地生成各种主题的室内自定义设计,无论您是在设想现代、质朴、装饰艺术还是极简主义风格。 Ai图片处理 2025年06月05日 21 点赞 0 评论 147 浏览
Fellou Fellou是一款由Fellou AI推出的智能浏览器,集成了智能体技术与工作流自动化,能自动执行复杂任务,提升操作效率。其核心功能包括深度行动、主动智能、影子空间、智能体网络等,支持跨平台搜索、多任务并行及个性化服务。用户可通过简单指令完成数据采集、表单填写、报告生成等操作,适用于市场调研、行为预测及多场景协作等应用场景。 AI项目与工具 2025年06月11日 66 点赞 0 评论 147 浏览
ImageBind ImageBind是由Meta公司开发的开源多模态AI模型,能够整合文本、音频、视觉、温度和运动数据等多种模态的信息,并将其统一到一个嵌入空间中。该模型通过图像模态实现其他模态数据的隐式对齐,支持跨模态检索和零样本学习。它在增强现实(AR)、虚拟现实(VR)、内容推荐系统、自动标注和元数据生成等领域有广泛应用。 AI项目与工具 2025年06月12日 16 点赞 0 评论 148 浏览
LongLLaVA LongLLaVA是由香港中文大学(深圳)研究团队开发的多模态大型语言模型,结合Mamba和Transformer模块,利用2D池化技术压缩图像token,大幅提升处理大规模图像数据的效率。该模型在视频理解、高分辨率图像分析及多模态代理任务中表现优异,特别擅长检索、计数和排序任务。其技术亮点包括渐进式训练策略和混合架构优化,支持多种多模态输入处理,广泛应用于视频分析、医学影像诊断、环境监测等领域。 AI项目与工具 2025年06月12日 67 点赞 0 评论 148 浏览
通义浏览器插件 通义浏览器插件是一款集实时语音识别、AI字幕翻译、智能总结于一体的多功能AI工具。支持在线课程、会议记录、外语视频观看等多种应用场景,提供语音转文字、翻译、内容总结等功能,帮助用户高效管理在线信息。此外,用户可通过插件快速访问网页版平台,查看和整理记录内容,实现更便捷的信息处理体验。 AI项目与工具 2025年06月12日 84 点赞 0 评论 148 浏览