模型

Leffa

Leffa是一种基于注意力机制的可控人物图像生成框架,通过流场学习精确控制人物的外观和姿势。其核心技术包括正则化损失函数、空间一致性及模型无关性,能够在保持细节的同时提升图像质量。Leffa广泛应用于虚拟试穿、增强现实、游戏开发及影视后期制作等领域,展现出卓越的性能与灵活性。

olmOCR

olmOCR 是一款开源 PDF 文档处理工具,结合文档锚定技术和 Qwen2-VL-7B-Instruct 模型,可高效提取结构化文本并保留原始布局。支持多种文档类型,具备大规模批量处理能力和低成本优势,适用于学术研究、法律文件处理、企业文档管理及数字图书馆建设等多个场景。其开源特性与可扩展性也增强了用户的使用灵活性。

StarVector

StarVector 是一个开源多模态视觉语言模型,支持图像和文本到可编辑 SVG 文件的转换。采用多模态架构,结合图像编码与语言模型,生成结构紧凑、语义丰富的 SVG 内容。基于 SVG-Stack 数据集训练,适用于图标设计、艺术创作、数据可视化等多种场景,具备良好的性能和扩展性。

天壤小白大模型

天壤自研新一代通用语言大模型,具备面向多语言的对话互动、知识问答、逻辑推理等核心能力。

Askchat.ai

一个基于chatGPT,提供永久角色扮演和prompt工具的人工智能网站,Askchat.ai使用GPT-3.5和GPT-4.0算法进行训练。能够理解和解释人类自然语言,并用合适的方式进行回答。

ItiNera

ItiNera是一款由香港大学与麻省理工学院合作开发的智能城市行程规划系统,基于大型语言模型和空间优化技术,为用户提供个性化、高效、连贯的Citywalk路线规划服务。系统包含兴趣点数据库构建、请求解析、偏好感知检索、空间优化及行程生成五大模块,支持实时动态信息更新,适用于个人旅游、城市漫步、短途旅行等多种场景。

Vision Parse

Vision Parse 是一款开源工具,旨在通过视觉语言模型将 PDF 文件转换为 Markdown 格式。它具备智能识别和提取 PDF 内容的能力,包括文本和表格,并能保持原有格式与结构。此外,Vision Parse 支持多种视觉语言模型,确保解析的高精度与高速度。其应用场景广泛,涵盖学术研究、法律文件处理、技术支持文档以及电子书制作等领域。

提示词交易站| Tipstore

提示词交易站| Tipstore,你可以在这里找到各类提示词,帮助你更好的使用AI工具,提升工作效率。如果您是一位优秀的提示词创作者,您可以在这里销售自己的提示词。

Video Alchemist

Video Alchemist是一款由Snap公司研发的视频生成模型,支持多主体和开放集合的个性化视频生成。它基于Diffusion Transformer模块,通过文本提示和参考图像生成视频内容,无需测试优化。模型引入自动数据构建和图像增强技术,提升主体识别能力。同时,研究团队提出MSRVTT-Personalization基准,用于评估视频个性化效果。该工具适用于短视频创作、动画制作、教育、剧

Kimi Latest

Kimi Latest是月之暗面推出的实时更新AI模型,支持128k上下文长度,可自动选择模型规模并优化成本。具备图像理解、自动上下文缓存和多模态处理能力,适用于聊天应用、内容创作及数据分析等多种场景,为开发者和用户提供稳定高效的AI解决方案。