AI项目与工具

ASAL

ASAL是一款基于基础模型设计的自动化人工生命探索工具,支持有监督目标搜索、开放式搜索和照明式搜索三大功能模块。它能够在多种人工生命基质中运行,提供定量分析能力,帮助研究者发现新颖且多样的生命现象。ASAL的技术核心包括视觉-语言基础模型、嵌入与相似性测量、优化算法及搜索策略,广泛应用于生物进化研究、智能机器人行为模拟、游戏AI开发等领域。 ---

PixWizard

PixWizard是一款基于自然语言指令的多功能图像处理工具,支持图像生成、编辑、翻译、修复等任务。通过基于流的Diffusion Transformer(DiT)模型及结构感知与语义感知指导,PixWizard能够高效处理各种视觉任务,并展现出强大的生成能力和泛化性能。

Firefly Image Model 4

Firefly Image Model 4 是 Adobe 推出的图像生成模型,支持高分辨率(最高2K)图像生成,并提供对图像结构、风格、视角等的精细控制。其增强版 Firefly Image Model 4 Ultra 特别适用于复杂场景和细节处理。该模型基于深度学习技术,包括 GAN 和 Diffusion Model,能够根据文本描述或参考图像生成高质量图像。广泛应用于创意设计、广告、艺术、

Willow 量子芯片

Willow量子芯片是一款由谷歌研发的新型量子处理器,集成了105个量子比特,并在量子纠错、计算性能和硬件稳定性方面取得显著进步。它能够在极短时间内完成复杂运算,远超现有超级计算机的能力,同时支持大规模扩展与实际应用,适用于医药、能源、人工智能等多个行业。

开搭

开搭是一款无需编程基础即可构建AI应用的一站式开发平台。它提供拖拽式开发、参数配置、快速搭建及一键发布等功能,帮助用户轻松创建并发布AI机器人。该工具适用于客户服务、教育、健康咨询等多个领域,支持知识变现,适合各类人群参与AI创新。

ViewCrafter

ViewCrafter是一种由北京大学、香港中文大学和腾讯合作开发的先进视频扩散模型。它能够从单一或少量图像中合成高质量的新视图,结合视频扩散模型和基于点的3D表示,通过迭代视图合成策略和相机轨迹规划生成多样化的视图。该模型在多个数据集上展示了强大的泛化能力和性能,适用于实时渲染、沉浸式体验及场景级文本到3D生成等多种应用场景。

URO

URO-Bench 是一个面向端到端语音对话模型的综合评估工具,支持多语言、多轮对话及副语言信息处理。它包含基础和高级两个赛道,分别涵盖16个和20个数据集,覆盖开放性问答、情感生成、多语言任务等。支持多种评估指标,提供简单易用的评估流程,并兼容多种语音对话模型。适用于智能家居、个人助理、语言学习等多个实际应用场景。

Vibe Draw

Vibe Draw是一款开源AI 3D建模工具,能将2D草图自动转换为高质量3D模型,并支持文本提示优化和模型编辑。用户可一键导出为glTF格式,适用于创意设计、教育、游戏开发等多个领域。工具基于Next.js、React、Three.js、FastAPI等技术,具备高效的实时交互与异步处理能力。

RSIDiff

RSIDiff 是一种基于递归自训练的文本到图像生成优化框架,通过高质量提示构建、偏好采样和分布加权机制,提升图像质量和与人类偏好的对齐度,减少训练崩溃风险。它具备自演化能力,降低对大规模数据的依赖,广泛应用于艺术创作、广告设计、VR/AR、游戏开发等领域。

Spark

Spark-TTS是一款基于大型语言模型的高效文本转语音工具,支持中英文双语及跨语言合成。它无需额外生成模型,通过LLM预测编码直接生成音频,实现零样本语音克隆。用户可自定义语音参数,如音色、语速等,适用于语音助手、多语言内容创作、智能客服及虚拟角色配音等多种场景。