Docling Docling 是一款开源工具,支持多种文档格式的解析与转换,包括 PDF、DOCX、PPTX、图片和 HTML。它通过高级 PDF 理解和 OCR 技术,将文档内容转换为统一的结构化格式(如 Markdown 和 JSON)。Docling 可与 LlamaIndex 和 LangChain 集成,增强文档的检索和问答能力,并提供简洁的命令行界面,适用于自动化文档处理、数据科学、知识管理和信息检 AI项目与工具 2025年06月12日 41 点赞 0 评论 317 浏览
Jina Jina-embeddings-v3 是一款基于 Transformer 架构的文本嵌入模型,支持多语言处理和长文本分析。通过 LoRA 适配器和 Matryoshka 表示学习技术,模型能够生成高质量的嵌入向量,适用于多种任务,包括查询-文档检索、聚类、分类和文本匹配。其高性能和成本效益使其适用于生产环境及边缘计算场景。 AI项目与工具 2025年06月12日 24 点赞 0 评论 312 浏览
Airweave Airweave 是一款开源数据同步工具,支持将多种数据源(如 API、数据库、网站等)同步到图数据库和向量数据库中,提升数据检索效率。其核心功能包括无代码集成、多租户支持、数据分块、自动同步及版本控制。支持多种向量数据库,并提供灵活的部署方式,适用于企业开发、数据分析、SaaS 平台及内容管理等多个场景。 AI项目与工具 2025年06月12日 46 点赞 0 评论 312 浏览
PaSa PaSa是由字节跳动研发的基于强化学习的学术论文检索系统,能够模仿人类研究者行为,自动调用搜索引擎、分析论文内容并追踪引文网络,提供精准全面的学术文献检索服务。其核心技术包括Crawler和Selector两个智能体,结合强化学习优化,显著提升了搜索效率与准确率。PaSa适用于学术研究、高校教学、知识产权分析等多个领域,具备高效检索和复杂查询处理能力。 AI项目与工具 2025年06月12日 41 点赞 0 评论 310 浏览
ReasonIR ReasonIR-8B 是由 Meta AI 开发的推理密集型检索模型,基于 LLaMA3.1-8B 训练,采用双编码器架构,提升复杂查询处理能力。结合合成数据生成工具,增强模型在长上下文和抽象问题中的表现。在多个基准测试中表现优异,适用于问答系统、教育、企业知识管理和科研等领域。 AI项目与工具 2025年06月11日 11 点赞 0 评论 309 浏览
Jina AI 一家一家专注于神经搜索技术的商业开源软件公司,Jina AI致力于通过深度学习技术简化非结构化数据的搜索,提供高效、准确的搜索解决方案。 AI搜索问答 2025年06月05日 80 点赞 0 评论 304 浏览
Baklib Baklib是一款企业级数字内容管理平台,通过资源库、知识库和应用库三大模块,实现数字资产全生命周期管理、知识体系构建与多场景内容系统搭建。支持智能检索、AI内容生成、多语言与多渠道分发,提升企业内容管理效率与用户体验。 AI项目与工具 2025年06月12日 11 点赞 0 评论 302 浏览
千笔AI论文写作 AI原创论文写作平台,千笔AI论文具备选题、文献检索、写作助手等多项实用功能,提供真实网络数据、图、表、公式、代码,不限次2000字3级大纲,附带ppt、开题报告、任务书、40篇真实参考文献。 AI写作对话 2025年06月05日 55 点赞 0 评论 300 浏览
Docmatix Docmatix 是一个专为文档视觉问答任务设计的大规模数据集,包含240万张图像和950万个问题-答案对,源自130万个PDF文档。数据集覆盖广泛,包括扫描图片、PDF文件和数字文档,且具有高质量的问答对。Docmatix 支持模型训练和微调,可用于训练视觉语言模型,提高其在理解和回答与文档内容相关问题方面的性能。应用场景包括自动化客户服务、智能文档分析、教育和学术研究以及业务流程自动化等。 AI项目与工具 2025年06月12日 87 点赞 0 评论 294 浏览