AI

BiRead

BiRead是一款基于人工智能技术的浏览器扩展工具,支持即时双语转换、广泛的语言支持、学习模式以及社交媒体翻译等功能。它帮助用户克服语言障碍,提高阅读外文内容时的理解能力,适用于多种应用场景,如学术研究、商务交流、日常娱乐等。

Thetawave AI

Thetawave AI 是一款面向大学生的智能笔记工具,支持实时课堂转录、视频内容提炼、PPT 内容整理等功能。它能自动生成结构化笔记,并提供聊天机器人、思维导图、Flashcard 和 Quiz 等辅助学习工具,提升学习效率与知识整理能力。

AI外教

AI外教是一款利用人工智能技术的虚拟外教口语学习应用,提供个性化的一对一口语练习、实时语法纠错、发音评分及专项备考功能,覆盖雅思、考研、四六级等多种考试题库。此外,它还结合哈佛系统课和CEFR分级体系,帮助用户循序渐进地提高英语口语能力,同时提供翻译、写作辅助等智能工具。 ---

MoshiVis

MoshiVis是一款由Kyutai开发的开源多模态语音模型,支持图像与语音的自然交互。它基于Moshi 7B架构,集成了视觉编码器和跨注意力机制,实现低延迟、自然流畅的对话体验。支持多种后端部署,适用于无障碍应用、智能家居、教育及工业场景,提升人机交互的智能化水平。

LEOPARD

LEOPARD是一款由腾讯AI Lab开发的视觉语言模型,专为处理包含大量文本的多图像任务而设计。它通过自适应高分辨率多图像编码模块和大规模多模态指令调优数据集,实现对复杂视觉语言任务的高效处理,包括跨图像推理、高分辨率图像处理及动态视觉序列长度优化。LEOPARD在自动化文档理解、教育、商业智能等领域具有广泛应用潜力。

InternVL

InternVL是由上海人工智能实验室开发的多模态大模型,融合视觉与语言处理能力,支持图像、视频、文本等多种输入。其基于ViT-MLP-LLM架构,具备多模态理解、多语言处理、文档解析、科学推理等能力,广泛应用于视觉问答、智能客服、图像分析等领域。模型采用动态高分辨率与渐进式训练策略,提升处理效率与准确性。

擎舵

擎舵是百度营销推出的多模态AIGC创意生产平台,专注于视频、图片、文字等内容的智能生成。平台通过百度大模型技术支持,实现一键生成视频、图片、文字,自动识别视频素材内容,生成营销图,制作数字人视频,支持图片数字人生成及数字人形象与语音定制。擎舵服务于教育、汽车、旅游等多个行业,提供全流程AI赋能,帮助用户提升营销效率。

WebAgent

WebAgent是阿里巴巴开源的自主搜索AI Agent,具备端到端的自主信息检索与多步推理能力。它能主动搜索多个学术数据库,筛选、分析最相关的文献,整合不同文献中的观点,为用户提供全面且精准的研究报告。WebAgent基于创新的数据合成方法和高效的训练策略,实现高效的多步推理和信息检索能力,适用于学术研究、商业决策和日常生活等多种场景。

Gnomic

Gnomic智能体立足AI Agent生态体系构建,通过打造AI Agent多模态生态平台,帮助开发者快速设计和训练个性化的智能体。

SOLAMI

SOLAMI是一款基于VR环境的3D角色扮演AI系统,支持用户通过语音和肢体语言与虚拟角色进行沉浸式互动。系统采用社交视觉-语言-行为模型(Social VLA),可识别用户的多模态输入并生成相应响应,涵盖多种角色类型及互动场景,如游戏、舞蹈等。其核心技术涉及多任务预训练和指令微调,适用于虚拟社交、教育、心理治疗及娱乐等多个领域。