AI项目与工具

Voyage Multimodal

Voyage Multimodal-3 是一款多模态嵌入模型,能够处理文本、图像以及它们的混合数据,无需复杂文档解析即可提取关键视觉特征。它在多模态检索任务中的准确率显著高于现有最佳模型,支持语义搜索和文档理解,适用于法律、金融、医疗等多个领域的复杂文档检索任务。

Browseragent

Browseragent是一款基于浏览器的AI自动化工具,支持无代码可视化工作流构建,可在本地运行以保障数据安全。用户可轻松实现文本处理、网页抓取、文件操作等任务,适用于内容创作、电商运营、数据分析等多个场景。通过Chrome扩展便捷访问,降低AI技术使用门槛,提升工作效率。

MobA

MobA是一种基于多模态大型语言模型的移动智能体,通过高级全局智能体(GA)和低级局部智能体(LA)的两级架构,实现任务规划、分解与执行,支持跨应用操作和自动化流程。其反思模块助力高效处理复杂任务,广泛应用于个人助理、智能家居控制、移动设备自动化及教育等领域。

misgif

misgif是一款基于AI的创意工具,通过面部替换技术将用户照片融入热门GIF、影视片段中,生成个性化表情包和视频。它支持多平台操作,拥有丰富的媒体库和强大的编辑功能,适合个人娱乐、社交媒体内容创作及品牌营销推广,同时提升群聊互动趣味性。

Llasa TTS

Llasa TTS是基于LLaMA架构的开源文本转语音模型,支持高质量语音合成、情感表达和音色克隆。采用单层VQ编解码器和Transformer结构,具备多语言支持及长文本处理能力,适用于智能助手、有声读物、游戏娱乐等场景。模型提供不同参数规模版本,支持零样本学习,提升语音自然度和表现力。

Baichuan4

Baichuan4-Finance是一款针对金融领域的增强型大语言模型,融合了通用与专业能力。它支持金融知识的理解与生成、金融认证问题解答、多轮对话交互、文档处理以及数据分析等功能,并通过领域自约束训练、混合数据策略及强化学习等技术手段优化性能。该模型适用于智能投顾、自动化客户服务、风险评估与管理等多个应用场景,旨在促进金融行业的智能化转型。

ImgCreator

ImgCreator 是一款基于人工智能的图像生成工具,支持文本到图像的转换,并提供丰富的编辑功能,包括背景替换、图像修复等。其主要用途涵盖社交媒体内容创作、电商产品展示、广告设计以及教育材料制作等领域,是一款高效且易用的设计辅助工具。

百度搜索MCP广场

百度搜索MCP广场是百度搜索AI开放平台提供的MCP Servers集成平台,为开发者提供海量服务资源,涵盖搜索、地图、文件系统等多个领域。平台具备智能搜索与推荐功能,支持快速筛选和集成所需服务,提升开发效率。同时支持本地与云端部署,适用于AI应用开发、多模态生成、企业级解决方案及内容创作等多种场景。

Lovify

Lovify 是一款面向开发者的 Chrome 扩展工具,提供智能代码提示、语音交互、GitHub 集成、项目规划、斜杠命令和自动化测试等功能,旨在提升开发效率与工作体验,适用于前后端及全栈开发场景。

OpenCity

OpenCity是一个由香港大学联合华南理工大学和百度共同研发的交通预测模型。该模型采用了Transformer架构和图神经网络,通过大规模预训练学习交通数据中的时空依赖关系,具有卓越的零样本预测能力和快速情境适应能力。OpenCity能够有效处理不同空间区域和时间的城市交通模式,并具备良好的可扩展性。其应用场景包括交通流量预测、交通拥堵分析、公共交通优化以及智能交通信号控制等。