AI工具

MoMask

MoMask是一款基于生成式掩码建模的3D人体动作生成工具,支持文本驱动的动作创建与编辑。采用分层量化与Transformer架构,实现高精度、连贯的3D动作序列生成,在HumanML3D数据集上的FID值仅为0.045。支持动作时序控制、多平台部署及动作评估功能,适用于游戏开发、动画制作、VR及体育分析等多个领域。

LaTRO

LaTRO(Latent Reasoning Optimization)是一种用于提升大型语言模型推理能力的框架,通过将推理过程视为潜在分布采样并采用变分推断方法进行优化,无需外部反馈即可增强模型生成高质量推理路径的能力。该框架支持自奖励机制、联合学习及梯度估计等技术,广泛应用于数学问题求解、科学问题解答、编程任务、逻辑推理以及自然语言理解等领域,有助于构建更智能、更自主的问题解决系统。

Gemini Embedding

Gemini Embedding 是 Google 推出的文本嵌入模型,能将文本转化为高维向量以捕捉语义和上下文信息。支持超过 100 种语言,具备高效的检索、分类、聚类和相似性检测能力。其支持长文本输入和灵活的维度调整,适用于多场景应用,如智能搜索、数据分析和自然语言处理。模型基于 Gemini 训练,具有优秀的语言理解能力。

EasySlide

EasySlide是一款基于AI的演示文稿生成工具,支持通过自然语言处理技术快速生成专业PPT。具备智能幻灯片生成、内容优化、多语言支持、模板选择等功能,还支持实时预览、编辑及多种格式导出。适用于企业演示、教育培训、学术研究、培训工作坊等多个领域,旨在提升演示文稿制作效率与质量。

狸谱

狸谱是一款集AI图像处理与互动创作于一体的多功能工具,提供“灵魂提取器”功能用于生成物体相关人设形象,同时拥有AI壁纸漫画创作、跑团剧情互动及自定义画风等功能。狸谱凭借其多模态大模型技术和丰富的应用场景,满足用户在娱乐、创意、教育等多个领域的多样化需求。

News Agents

News Agents是一个基于终端的新闻聚合与摘要系统,利用Amazon Q CLI作为Agent框架,通过Model Context Protocol(MCP)解析RSS新闻源,并借助tmux实现多任务监控。系统从多个新闻源抓取文章,分配给多个子Agents并行处理,生成简洁摘要并汇总到main-summary.md文件中,提供高效、个性化的新闻阅读体验。

CLaMP 3

CLaMP 3是由清华大学朱文武教授团队开发的多模态、多语言音乐信息检索框架,支持文本、图像、音频和乐谱等多种模态之间的跨模态检索。其基于对比学习技术,将不同模态数据与多语言文本对齐至统一语义空间,适用于文本到音乐、图像到音乐检索、零样本分类及音乐推荐等任务。支持27种语言,可扩展至100种,广泛应用于音乐创作、教育、分析及多媒体内容制作。

PDF to Podcast

PDF to Podcast 是一款由 NVIDIA 开发的 AI 工具,能够将 PDF 文档自动转换为高质量的音频内容,如播客。该工具结合了大型语言模型、文本到语音技术以及 NVIDIA NIM 微服务架构,支持从 PDF 提取信息并生成结构化文本,再通过语音合成输出自然流畅的音频。用户可自定义生成内容的重点,并支持多种部署方式,适用于企业培训、技术简报、客户服务、医疗教育等多个领域。

AI Photo Enhancer

AI Photo Enhancer是一款利用AI技术的在线图像增强工具,可将图片放大至10倍且保持清晰度,支持多种格式及批量处理。其主要功能包括高倍放大与细节保留、针对不同风格的照片优化、快速处理时间及多场景应用,如旧照片修复、电商产品展示、肖像优化和风景摄影等。

Mixo

Mixo是一款基于人工智能的网站构建平台,支持用户通过简短描述快速生成专业网站,涵盖着陆页和订阅页面等功能。它具备集成化的订阅者管理工具,并提供邮件、问卷调查等多种互动方式,适用于初创企业、产品预发布、电商、个人品牌展示及活动策划等多个场景。无需编程或设计基础,用户即可借助其友好的界面快速搭建高效网站。