图像处理 分类 - AI 工具网
关于本分类
AI 图像工具覆盖抠图、放大、修复、换脸与风格化处理,面向修图与设计增效。本分类汇集主流图像处理产品。
使用建议:换脸与深度编辑涉及肖像权,使用前须获得授权;输出用于公开渠道请遵守相关法规。
Q:图像修复效果可靠吗?
对划痕、模糊等常见损伤效果较好,严重损毁仍需人工处理。
Q:换脸功能有什么风险?
可能侵犯肖像权并带来诈骗风险,务必获得被摄者同意并合法使用。
站长亲测
真实推荐 · 含推广链接热门工具
24 个工具Midjourney
主打艺术化创意生图的 AI 图像工具,在概念设计、插画、氛围图这类看重美学的场景里口碑最好。当前默认版本 V8.2(2026 年 7 月起),V8.1 起支持原生 2K 直出、标准任务提速约 4-5 倍,V8.0 alpha 已下线;V8.2 主打美学表现、个性化和新的 Edit Model。没有免费额度,需要付费订阅(分多档,年付有折扣)。画质是否「天花板」属于主观评价,实际选型建议按风格偏好自己试。注意它主要通过 Discord 和网页端使用,工作流与常规设计软件不同。
Stable Diffusion
Stability AI 的开源图像生成模型,是本地部署绘图和模型微调生态的基础之一。截至 2026 年 9 月,官方当前图像模型仍是 Stable Diffusion 3.5 系列(2024 年 10 月首发,含 Large / Turbo / Medium),社区许可下年营收 100 万美元以内可免费自部署商用,超出需企业授权。官方 2026 年的新品集中在 Stable Audio 3.0 和 Brand Studio。网传的「Stable Diffusion 4」在官网和官方 Hugging Face 均无发布记录,不宜采信。适合想本地部署、自己训练或微调模型的用户。
腾讯混元
腾讯自研大模型,提供对话、生图、生视频、文/图生 3D 和语音识别等多模态能力,适合在腾讯云与腾讯文档生态内使用的企业场景。当前旗舰是 Hy4(2026 年 8 月更新,770B / 49B、100 万 token 上下文),主打 Agent、编程与长文办公,但仍标注 preview 状态;Hy3 于 2026 年 7 月正式发布。多模态侧有 HY Image 3.0 Plus(生图)、生视频、文/图生 3D 和 Hy ASR 3.0。注意版本命名与 preview 状态容易混淆,生产环境接入前建议先确认版本稳定性。
DALL·E 3
OpenAI 官方的文生图模型,集成在 ChatGPT 里。对自然语言理解最好,你用大白话描述它就能生成,不需要复杂的 Prompt 工程。适合快速出概念图、插画、设计草图。缺点是风格偏写实,艺术感不如 Midjourney,而且需要 ChatGPT Plus 才能用。
Pixlr
浏览器端的在线图片编辑与 AI 修图平台,无需安装即可使用,提供智能抠图、画面扩图、背景替换、一键美化与 AI 模板生成等能力,覆盖从简单裁剪调色到快速去背出图的常见需求。免费与付费档位并存,免费档在导出规格与可用功能上有限制。适合不想安装桌面软件、修图需求以轻量处理为主的新手与运营人员。需要注意的是,在线处理高清大图会受上传体积与网络速度影响,商用素材建议先确认当前档位的授权与导出规格。
Prolificdreamer
一种高保真、多样化的文本生成 3D 方法,发表于 NeurIPS 2023,主要面向研究与算法验证场景,可作为理解文生 3D 技术路线的参考。仓库提供论文与复现说明,适合有 3D 生成研究需求的开发者。需要注意的是,这类方法对算力与显存要求较高,实际复现成本不低,落地前建议先评估硬件条件与预期投入。
Stable Dreamfusion
文本或图像转 3D 网格的生成方案,输出的模型可导出用于后续编辑与渲染,主要面向研究与技术验证场景,适合需要了解文生 3D 实现方式的开发者参考。需要注意的是,该方案的生成耗时与算力开销较大,更适合研究与验证用途,落地生产前建议先评估硬件与时间成本。
Dreamgaussian
高效的 3D 内容生成方法,发表于 ICLR 2024,主打在较短时间内由图像生成 3D 资产,适合有 3D 生成研究或快速原型需求的技术人员参考其实现细节。需要注意的是,这类方法生成的模型细节精度有限,若用于正式项目通常还需后续修复与优化,建议先在小样本上验证。
Lgm
LGM(Large Multi-View Gaussian Model)是发表于 ECCV 2024 的 3D 内容生成方案,思路是用大规模多视图高斯表示,在较短时间内把文本或图像提示转成可渲染的 3D 资产。项目开放了论文与代码,主要面向研究与算法验证场景,也可作为理解高斯泼溅路线在 3D 生成中应用的参考。需要注意的是,这类研究型方案对显存与训练环境要求较高,复现成本不低,落地前建议先确认硬件条件与预期产出精度。
ClipDrop
Stability AI 旗下的 AI 图像处理工具集,把抠图、扩图、背景替换、光照重绘与物体移除拆成多个独立入口,可以按需单点使用,不必进入完整设计软件。对电商产品图尤为实用,能较快处理出干净的白底图与场景图。多数功能提供有限次数的免费试用,正式使用需订阅。需要注意的是,各功能的效果对原图分辨率与主体边缘复杂度较为敏感,透明材质、毛发边缘等场景建议先做小样测试再批量处理。
Craiyon
免费的 AI 文生图工具,输入一段文字描述即可一次生成多张候选图,无需注册即可试用,界面简单、上手门槛低,适合用来快速验证构图想法或做概念参考。需要注意的是,其模型能力以轻量、免费为定位,画面精细度与文字渲染能力明显弱于主流商业绘图工具,输出更适合作为灵感参考而非直接投入使用的成品素材;免费使用通常需要排队等待。
Instantmesh
InstantMesh 是一个单图生成 3D 网格的开源方案,思路是从一张图片出发快速重建出带贴图的 3D 模型,输出网格可直接导入常见建模与实时渲染流程。项目由腾讯 ARC 实验室开源,提供论文与代码,主要面向研究与算法验证场景,也适合需要快速做 3D 原型的技术人员参考实现细节。需要注意的是,单图重建对原图视角与遮挡情况较敏感,生成模型在薄结构与背面细节上通常需要人工修补,正式使用前建议先做小样本验证。
创客贴AI
国内在线设计平台,以模板库为基础,覆盖海报、公众号配图、电商主图、简历与 PPT 等常见物料,并提供 AI 生图、智能排版与抠图等辅助能力,让没有设计基础的用户也能较快产出可用图。提供免费模板与付费素材,商业使用需确认素材授权。需要注意的是,模板化产出容易与他人作品撞图,用于正式商业物料时建议替换主视觉与文案,并核对所用字体、图片的授权范围。
Hy Motion 1.0
HY-Motion 是腾讯混元团队推出的 3D 人体运动生成模型,用于根据文字描述生成角色动画动作,输出可用于 3D 角色驱动的运动数据。站内把它归入 3D 建模类,适合游戏开发、数字人与动画制作中需要快速获得动作草稿的场景。需要注意的是,生成的动作在物理合理性与风格细节上通常需要人工调整,正式用于项目前建议结合骨骼绑定做一次适配测试,确认与目标引擎的兼容性。
DreamStudio
Stability AI 官方的在线生图平台,基于自家 Stable Diffusion 系列模型,界面提供提示词、采样步数、风格预设与画面比例等参数调节,适合不想本地部署、只想快速验证模型表现的绘画用户。按生成次数消耗点数计费,新用户通常有试用额度。需要注意的是,在线平台使用的是官方托管模型,与社区微调模型在风格多样性上存在差异,追求特定画风时仍需结合本地工作流或第三方模型站。
Lexica
AI 图像搜索与创作平台,收录了大量由 Stable Diffusion 等模型生成的作品,可按关键词与风格检索,并直接查看、复用对应的提示词参数,是找参考图与学习提示词写法的常用去处;平台也提供在线生图入口。适合绘画爱好者与需要风格参考的设计人员。需要注意的是,站内作品多由用户上传,授权与商用条件并不统一,将他人作品直接用于商业项目存在风险,建议只把提示词当作参考。
妙鸭相机
阿里推出的 AI 写真生成应用,用户上传一定数量的本人照片后,由模型生成多种风格的艺术写真,覆盖证件照、国风、职业形象等常见需求,省去线下拍摄与修图环节。按套系付费,生成前需完成人脸素材上传与训练。适合需要快速获得规范形象照的用户。需要注意的是,上传人脸照片涉及个人信息,使用前应确认平台的数据使用与存储说明;生成结果与上传素材的数量、清晰度和角度多样性关系较大。
Mmdetection3D
MMDetection3D 是 OpenMMLab 推出的 3D 目标检测开源工具箱,面向点云与多模态数据,提供统一的训练、推理与评测流程,覆盖自动驾驶、机器人感知等场景中常见的检测算法实现,方便研究者复现与横向对比不同方法。适合做 3D 感知方向的研究人员与算法工程师。需要注意的是,该工具箱面向开发与研究,使用前需要熟悉其配置体系与依赖环境,实际部署还要结合具体传感器与数据格式做适配。
Zero123Plus
Zero123++ 是一个单图生成一致多视图的扩散模型,作为 3D 生成流程中的基础组件,能从一张输入图片推断出多个角度的一致视图,再交由后续算法重建为 3D 模型。项目开源发布,主要面向研究与算法验证场景,适合关注文生 3D、图生 3D 技术路线的开发者参考其实现方式。需要注意的是,多视图推断的一致性有限,纹理细节与不可见区域的重建质量依赖输入图片与后续步骤,实际使用前建议先做小样本测试。
Objaverse Xl
Objaverse-XL 是一个大规模 3D 对象数据集,收录超过 1000 万个 3D 资产,覆盖多种类别与来源,用于训练与评测 3D 生成、理解与检索类模型。适合需要大规模 3D 数据做训练或基准测试的研究团队与算法开发者。需要注意的是,数据集内的资产来源多样,许可与商用条件并不统一,直接用于商业产品或二次分发前需逐项确认授权;数据集体量较大,下载与存储也需要相应准备。
Hunyuanworld 1.0
腾讯混元团队推出的 3D 世界生成项目,可依据文字描述或像素图生成可探索的 3D 场景,面向游戏原型、虚拟场景搭建与沉浸式内容创作等场景。站内把它归入 3D 建模类,适合希望快速产出可漫游场景草稿、而不想从零搭建地形的开发者与创作者。需要注意的是,生成场景在细节精度与物理合理性上通常需要后续加工,正式项目使用前建议先在目标引擎中测试导入效果与性能表现。
3Dcellforge
一个开源的 3D 模型生成与展示工具,站内描述其定位为交互式的 3D 创作工作台,可结合 AI 能力生成模型并直接在浏览器中查看与调整,适合做模型预览、快速原型与技术验证。项目在 GitHub 上开放源码。需要注意的是,这类早期项目在功能完整度与稳定性上仍在演进,正式项目使用前建议先确认其依赖环境与输出格式是否满足需求,并为后续可能的接口变更留出适配成本。
Pixelcut
面向电商场景的 AI 图像处理工具,可一键去除背景并替换成纯色或场景背景,支持批量处理商品图、统一尺寸与基础美化,输出适合直接用于商品页与社交平台素材。同时提供移动端应用,便于随时处理图片。免费档有处理数量与导出规格限制,高阶功能需订阅。需要注意的是,透明材质、毛绒边缘与细碎结构在自动抠图时容易残留杂边,正式上架前建议逐张检查边缘质量。
Trellis.2
TRELLIS 系列的第二代 3D 生成方案,由微软相关团队开源,核心思路是在结构化的潜空间中对 3D 资产进行表示与生成,可用文字或图像提示产出带结构信息的 3D 模型,输出便于后续编辑与渲染。主要面向研究、算法验证与需要自建生成能力的技术团队。需要注意的是,这类研究型方案对显存与运行环境要求较高,从代码到可用服务之间还有较大的工程化工作量,落地前建议先评估硬件投入与团队适配成本。
AI 对话2 个工具
腾讯混元
腾讯自研大模型,提供对话、生图、生视频、文/图生 3D 和语音识别等多模态能力,适合在腾讯云与腾讯文档生态内使用的企业场景。当前旗舰是 Hy4(2026 年 8 月更新,770B / 49B、100 万 token 上下文),主打 Agent、编程与长文办公,但仍标注 preview 状态;Hy3 于 2026 年 7 月正式发布。多模态侧有 HY Image 3.0 Plus(生图)、生视频、文/图生 3D 和 Hy ASR 3.0。注意版本命名与 preview 状态容易混淆,生产环境接入前建议先确认版本稳定性。
阶跃星辰
阶跃星辰推出的多模态大模型产品,Step 系列覆盖语言、语音、图像与视频等模态,可通过网页端完成对话问答、文档理解、内容生成与代码辅助等任务,并对外开放模型接口供开发者调用,面向中文场景做了较多适配。适合希望在日常办公与开发中接入大模型的用户。需要注意的是,模型能力与可用功能会随版本迭代变化,涉及专业领域结论时建议交叉核对来源,接口的具体计费与限流规则以官方文档为准。
AI 设计68 个工具
Midjourney
主打艺术化创意生图的 AI 图像工具,在概念设计、插画、氛围图这类看重美学的场景里口碑最好。当前默认版本 V8.2(2026 年 7 月起),V8.1 起支持原生 2K 直出、标准任务提速约 4-5 倍,V8.0 alpha 已下线;V8.2 主打美学表现、个性化和新的 Edit Model。没有免费额度,需要付费订阅(分多档,年付有折扣)。画质是否「天花板」属于主观评价,实际选型建议按风格偏好自己试。注意它主要通过 Discord 和网页端使用,工作流与常规设计软件不同。
Stable Diffusion
Stability AI 的开源图像生成模型,是本地部署绘图和模型微调生态的基础之一。截至 2026 年 9 月,官方当前图像模型仍是 Stable Diffusion 3.5 系列(2024 年 10 月首发,含 Large / Turbo / Medium),社区许可下年营收 100 万美元以内可免费自部署商用,超出需企业授权。官方 2026 年的新品集中在 Stable Audio 3.0 和 Brand Studio。网传的「Stable Diffusion 4」在官网和官方 Hugging Face 均无发布记录,不宜采信。适合想本地部署、自己训练或微调模型的用户。
DALL·E 3
OpenAI 官方的文生图模型,集成在 ChatGPT 里。对自然语言理解最好,你用大白话描述它就能生成,不需要复杂的 Prompt 工程。适合快速出概念图、插画、设计草图。缺点是风格偏写实,艺术感不如 Midjourney,而且需要 ChatGPT Plus 才能用。
Pixlr
浏览器端的在线图片编辑与 AI 修图平台,无需安装即可使用,提供智能抠图、画面扩图、背景替换、一键美化与 AI 模板生成等能力,覆盖从简单裁剪调色到快速去背出图的常见需求。免费与付费档位并存,免费档在导出规格与可用功能上有限制。适合不想安装桌面软件、修图需求以轻量处理为主的新手与运营人员。需要注意的是,在线处理高清大图会受上传体积与网络速度影响,商用素材建议先确认当前档位的授权与导出规格。
ClipDrop
Stability AI 旗下的 AI 图像处理工具集,把抠图、扩图、背景替换、光照重绘与物体移除拆成多个独立入口,可以按需单点使用,不必进入完整设计软件。对电商产品图尤为实用,能较快处理出干净的白底图与场景图。多数功能提供有限次数的免费试用,正式使用需订阅。需要注意的是,各功能的效果对原图分辨率与主体边缘复杂度较为敏感,透明材质、毛发边缘等场景建议先做小样测试再批量处理。
Craiyon
免费的 AI 文生图工具,输入一段文字描述即可一次生成多张候选图,无需注册即可试用,界面简单、上手门槛低,适合用来快速验证构图想法或做概念参考。需要注意的是,其模型能力以轻量、免费为定位,画面精细度与文字渲染能力明显弱于主流商业绘图工具,输出更适合作为灵感参考而非直接投入使用的成品素材;免费使用通常需要排队等待。
创客贴AI
国内在线设计平台,以模板库为基础,覆盖海报、公众号配图、电商主图、简历与 PPT 等常见物料,并提供 AI 生图、智能排版与抠图等辅助能力,让没有设计基础的用户也能较快产出可用图。提供免费模板与付费素材,商业使用需确认素材授权。需要注意的是,模板化产出容易与他人作品撞图,用于正式商业物料时建议替换主视觉与文案,并核对所用字体、图片的授权范围。
DreamStudio
Stability AI 官方的在线生图平台,基于自家 Stable Diffusion 系列模型,界面提供提示词、采样步数、风格预设与画面比例等参数调节,适合不想本地部署、只想快速验证模型表现的绘画用户。按生成次数消耗点数计费,新用户通常有试用额度。需要注意的是,在线平台使用的是官方托管模型,与社区微调模型在风格多样性上存在差异,追求特定画风时仍需结合本地工作流或第三方模型站。
Lexica
AI 图像搜索与创作平台,收录了大量由 Stable Diffusion 等模型生成的作品,可按关键词与风格检索,并直接查看、复用对应的提示词参数,是找参考图与学习提示词写法的常用去处;平台也提供在线生图入口。适合绘画爱好者与需要风格参考的设计人员。需要注意的是,站内作品多由用户上传,授权与商用条件并不统一,将他人作品直接用于商业项目存在风险,建议只把提示词当作参考。
妙鸭相机
阿里推出的 AI 写真生成应用,用户上传一定数量的本人照片后,由模型生成多种风格的艺术写真,覆盖证件照、国风、职业形象等常见需求,省去线下拍摄与修图环节。按套系付费,生成前需完成人脸素材上传与训练。适合需要快速获得规范形象照的用户。需要注意的是,上传人脸照片涉及个人信息,使用前应确认平台的数据使用与存储说明;生成结果与上传素材的数量、清晰度和角度多样性关系较大。
Pixelcut
面向电商场景的 AI 图像处理工具,可一键去除背景并替换成纯色或场景背景,支持批量处理商品图、统一尺寸与基础美化,输出适合直接用于商品页与社交平台素材。同时提供移动端应用,便于随时处理图片。免费档有处理数量与导出规格限制,高阶功能需订阅。需要注意的是,透明材质、毛绒边缘与细碎结构在自动抠图时容易残留杂边,正式上架前建议逐张检查边缘质量。
NightCafe
在线 AI 绘画社区与生成平台,内置多种生成模型与风格模板,支持文生图、图生图与风格迁移,可调整分辨率与采样步数等参数。平台设有作品广场与创作挑战,便于浏览他人作品、参考提示词写法,适合刚接触 AI 绘画的用户边玩边学。需要注意的是,不同模型与风格的效果差异明显,提示词写法对结果影响很大;平台的额度与商用授权规则会调整,正式用于商业项目前建议核对最新条款。
Artbreeder
在线 AI 图像生成与演化平台,通过对已有图像进行混合、调参得到新形象,可分别调整风格、色彩与细节强度,也能基于同一底图不断迭代出系列变体。常用于人像、风景与概念设定的灵感发散,社区作品可浏览并作为再创作的起点。需要注意的是,混合生成对细节的控制较为间接,精修仍需配合其他工具;涉及真人肖像与版权素材的混合生成可能存在授权争议,对外使用前应自行确认素材来源。
图怪兽
面向中文用户的在线设计平台,提供海报、公众号封面、电商主图与短视频封面等大量模板,拖拽替换文字与图片即可出图,并内置素材库、抠图与尺寸调整等辅助功能,降低非设计师的制作门槛。适合自媒体、小微商家与行政人员快速产出日常配图。需要注意的是,模板中的字体与素材可商用范围各有不同,对外投放前需核对授权说明;模板同质化较明显,重要物料建议做差异化调整。
Playground AI
在线 AI 绘图与图像编辑平台,支持文生图、图生图与局部重绘,可在画布上圈选区域后由模型按提示词修改,并提供多种模型与风格可选、画布尺寸自定义等能力。适合制作插画、海报、社媒配图与概念设定图。需要注意的是,不同模型的风格取向差异较大,同一提示词需要反复调试;局部重绘边缘的衔接有时不够自然,正式出图前建议放大检查细节,商用前也应确认素材与授权范围。
Fotor
综合性的在线图片编辑与设计平台,提供裁剪、调色、拼图与加字等常用功能,并集成 AI 抠图、智能放大、去背景与人像美化等能力,同时提供海报与社媒模板,可在浏览器中完成从修图到出图的全流程。适合个人用户和中小商家处理日常图片素材。需要注意的是,自动美化容易带来磨皮过度、五官失真等副作用,人像处理建议控制强度;模板与素材的可商用范围不同,对外发布前请核对授权说明。
Cleanup.pictures
在线图像修补工具,用画笔涂抹照片中不需要的物体、路人、水印或文字后,由模型自动补全背景并按原图的光影与质感还原,处理在浏览器内完成,上手门槛较低。适合修图过程中快速去掉画面里的干扰元素,也常用于清理商品图上的杂物与文字。需要注意的是,背景结构复杂或有大面积遮挡时,补全结果可能出现模糊与重复纹理,建议分区域多次处理并放大检查;版权与素材来源仍需自行确认。
Cutout Pro
在线图像与视频处理工具,提供自动抠图、证件照制作、人像修复与图片去水印等功能,也支持视频抠像与背景替换,处理过程在网页端完成,无需安装专业软件。适合电商商品图、证件照与短视频素材的批量去背需求。需要注意的是,发丝、透明材质与复杂边缘的抠图效果仍有提升空间,正式出图前建议逐张检查边缘;证件照等场景对规格有明确要求,应确认输出尺寸与背景色是否符合标准。
稿定AI
国内较早的在线设计平台,提供海报、电商主图、演示文稿与视频模板,并集成 AI 抠图、AI 生成配图与智能改图等能力,可在浏览器内完成从设计到导出的流程。适合自媒体、电商运营与中小企业快速产出营销物料。需要注意的是,模板中的字体与素材可商用范围不同,对外投放前需核对授权说明;AI 生成的配图在细节与品牌一致性上仍需人工调整。
Remove.bg
专注自动抠图的在线工具,上传图片后由算法识别人物与主体轮廓并输出透明背景结果,适合电商商品图、证件照与设计素材的快速去背,也提供批量处理与接口调用方式,便于把去背环节接入自动化流程。需要注意的是,发丝、透明材质与复杂边缘的抠图效果仍有提升空间,正式出图前建议逐张检查边缘;批量处理与更高分辨率输出通常需要按官方方案开通授权。
Lightweight Gan
轻量级生成对抗网络的 PyTorch 实现,面向小数据集与有限算力场景,用较少的参数量训练图像生成模型,适合作为论文复现与生成模型入门的学习材料,代码开源在 GitHub。需要注意的是,该仓库为研究性质的实现,训练结果受数据规模与超参数影响较大;生成图像的分辨率与细节有限,直接用于商业素材前需要评估质量与版权风险。
Deep Daze
基于 CLIP 与 SIREN 的文本生成图像开源项目,通过命令行输入文字描述即可优化生成图像,属于较早的文本引导生成实验实现。适合对生成模型原理感兴趣、希望用较少依赖复现实验的开发者。需要注意的是,该项目的生成速度较慢、画质与现代扩散模型存在明显差距,且需要一定的显存支持;作为学习与实验用途更合适,不建议用于生产素材。
Handtrack.Js
一个在浏览器中运行的实时手部检测 JavaScript 库,基于 TensorFlow.js 实现,可在网页或摄像头画面里定位手部位置并识别简单手势,适合做交互演示、体感小游戏与教学示例。需要注意的是,识别精度受光照、遮挡与摄像头质量影响明显,复杂背景下手势判定容易出错;在移动端运行会占用较多算力,建议降低帧率或分辨率以改善体验。
Draggan
图像编辑的研究项目,通过在生成过程中拖拽图上的控制点来调整物体形状、姿态与位置,同时保持其他区域基本不变,可实现笑眼、转头等精确编辑,论文发表于 SIGGRAPH,官方代码与在线演示已开放。适合研究生成模型可控编辑的开发者参考。需要注意的是,官方实现发布较早,依赖环境与当前主流框架版本存在差异,复现需要一定的工程调整;复杂形变下仍可能出现背景畸变,实际修图建议结合其他工具做局部修补。
Deep Live Cam
一款开源实时换脸工具,借助生成模型在视频流中把人物面部替换为指定图像,可用于视频通话与直播场景,也支持视频文件的离线处理,代码与模型权重已开放。需要注意的是,该工具极易被用于制造未经授权的深度伪造内容,可能侵犯他人肖像权并触犯相关法律法规,使用时必须取得当事人明确同意,不得用于伪造身份、传播虚假信息或任何违法用途;请务必评估法律与伦理风险后再决定是否使用。
Kornia
一个基于 PyTorch 的计算机视觉库,提供可微分的图像处理算子与几何变换,把传统视觉算法纳入深度学习流程,便于在模型内部直接完成数据增强、投影与坐标变换等操作。适合做三维视觉、相机标定与端到端视觉模型研究的开发者。需要注意的是,不同算子对输入张量的形状与取值范围有明确要求,组合使用时容易出现维度错误;涉及相机模型的参数约定需按文档设置,否则结果会出现难以察觉的偏差。
Pytorch Cyclegan
图像到图像转换模型的 PyTorch 实现,能够在不成对的训练数据下学习两个图像域之间的映射,常用于风格迁移、季节变换与图像增强等任务,代码结构清晰、便于阅读与改造。适合希望理解生成模型训练流程的学习者与研究者。需要注意的是,该实现以教学与实验为目标,未包含完整的工程化封装;训练结果对数据分布较为敏感,模式崩塌与内容失真仍可能出现,正式应用前需要扩大数据并做多轮调参。
Dalle Pytorch
DALL-E 文生图模型的 PyTorch 实现,把论文中的离散变分自编码器与大语言模型结合的两阶段思路落到实处,提供训练脚本与可调用的生成接口,便于研究者理解文本与图像的对齐方式并做二次实验。适合希望深入生成模型内部结构的开发者与研究者。需要注意的是,该实现与原论文的规模存在差距,复现效果受数据量与算力限制;训练此类模型对显存要求较高,个人环境建议先在缩小配置下跑通流程再评估。
Imagen Pytorch
Google Imagen 文生图模型的 PyTorch 实现,采用级联扩散结构与文本编码器的组合思路,仓库提供了模型结构的复现、训练要点与生成示例,便于研究者理解文本到图像生成的关键设计。适合做生成模型实验的开发者与研究者。需要注意的是,该仓库为论文实现的复现版本,未包含原论文的完整训练数据与算力条件,生成效果与原模型存在差距;训练对显存要求较高,个人环境建议先从小规模配置与推理示例入手。
WHEE
美图公司推出的 AI 图像创作平台,支持文生图、图生图与局部重绘,内置多种风格模型与模板,并提供一键改图、扩图与画质提升等编辑能力,可在网页端与移动端使用,输出内容常用于电商素材、社媒配图与个人创作。适合没有专业设计背景、需要快速产出图像的商家与创作者。需要注意的是,生成结果受提示词写法影响较大,同一风格需要反复调试;涉及品牌规范与商用授权时,应确认平台对生成内容的可用范围与版权约定。
Lambda Networks
一种用于图像识别的注意力机制实现,通过在局部窗口内引入内容相关的线性变换来降低计算开销,使模型在较小算力下也能达到较好精度,仓库提供官方代码结构与使用示例,便于研究者对比不同注意力方案。适合做视觉模型效率优化的开发者与研究者。需要注意的是,该实现以研究复现为目标,未包含完整的训练流程与工程封装;不同数据规模下的收益差异较大,替换注意力模块后需要在目标任务上重新训练与评估。
Midjourney Styles And Keywords Reference
一份整理图像生成工具风格与关键词用法的参考手册,按风格类别汇总常用提示词、参数与效果示例,并附对照图片,便于使用者查找并组合出想要的画面效果。适合刚开始使用图像生成工具、希望快速掌握提示词写法的创作者。需要注意的是,内容主要基于特定版本的生成工具,随着模型迭代,同一关键词的效果可能发生变化,参考时需要结合实际输出做调整;示例图片的版权与原作者的授权范围不同,直接用于商业素材前应确认来源。
Dreambooth Stable Diffusion
一项把个性化微调方法与传统图像生成模型结合的开源实现,通过少量目标图像训练出专属概念,再据此生成带有该主体的新画面,可用于制作个人化头像、产品概念图与风格系列图。适合做生成模型微调实验的开发者与创作者。需要注意的是,训练所用的图像须拥有相应权利,使用他人肖像或受版权保护的作品进行微调可能引发法律风险;训练对显存有一定要求,且批次过小容易导致过拟合,生成结果的多样性会明显下降。
Hama
一款在线的图像元素消除工具,用画笔涂抹照片中不需要的物体、路人或文字后,由算法自动补全背景,并按原图的光影与质感做还原,处理过程在浏览器中完成,无需安装专业软件。适合修图时快速清理画面干扰元素,也常用于整理商品图上的杂物。需要注意的是,背景结构复杂或遮挡面积较大时,补全结果可能出现模糊与重复纹理,建议分区域多次处理并放大检查边缘;素材的版权与来源仍需自行确认,避免处理他人作品后对外使用。
Dalle2 Pytorch
DALL-E 2 文生图模型的 PyTorch 实现,复现了以文本编码器与扩散解码器组合生成图像的关键结构,仓库提供模型定义、训练脚本与推理示例,便于研究者理解文本引导生成的技术路径并做二次实验。适合做生成模型研究的开发者。需要注意的是,该实现为论文复现版本,训练所需的数据与算力远超个人环境,生成质量与原模型存在差距,建议从推理与结构学习入手;涉及真人形象与版权素材的生成内容,对外使用前需要确认授权。
Ml Visuals
一份为机器学习从业者准备的可视化素材与模板集合,提供常用网络结构、流程与概念的示意图,并开放源文件便于修改颜色与标注,适合在论文、汇报与教学中快速产出规范配图。适合研究人员、学生与需要做技术讲解的人使用。需要注意的是,素材以英文标注为主,中文场景下需要自行替换文字并注意字体授权;使用时建议核对示意图与当前主流方法是否一致,涉及具体结构细节的配图仍应以原始论文为准,避免因转述产生偏差。
Gigagan Pytorch
GigaGAN 图像生成模型的 PyTorch 实现,复现了以生成对抗网络结构实现高分辨率图像合成的设计思路,仓库提供模型结构、训练要点与使用示例,便于研究者了解对抗式生成方法的实现细节。适合做生成模型研究的开发者。需要注意的是,该实现为论文复现版本,训练此类模型需要大规模数据与充足算力,个人环境通常只能做结构复现与小规模实验;对抗训练本身对超参数敏感,训练不稳定与模式崩塌仍可能出现,评估生成质量时应结合多种指标。
Self Attention Cv
一份系统讲解计算机视觉中自注意力机制的教程合集,从注意力计算的基本原理出发,结合代码逐步实现自注意力、多头注意力与视觉 Transformer 等结构,并讨论其在前景分割、图像识别等任务中的应用方式与常见实现细节。适合已掌握基础深度学习、希望理解注意力机制在视觉任务中如何运作的学习者与工程师。需要注意的是,教程内容分布在多篇文章中,阅读顺序与代码依赖需要按目录整理,部分文章年代较早,示例基于当时的框架版本,动手时可能需要调整接口;注意力机制的变体众多,具体选型应结合任务数据规模与算力条件做实验对比。
Pytorch Pretrained Biggan
BigGAN 图像生成模型的 PyTorch 实现,基于生成对抗网络结构实现高分辨率的类别条件图像合成,仓库提供预训练权重、模型定义与推理示例,便于研究者复现对抗生成方法并观察不同类别与截断参数对生成质量与多样性的影响。适合做生成模型研究与对比实验的开发者。需要注意的是,该实现基于较早的框架版本,在新环境中运行需要处理兼容性问题;训练此类模型需要大规模数据与充足算力,个人环境通常只能做推理与结构学习,生成样本在多样性上存在局限,用于数据增强或训练其他模型前应评估其带来的偏差,并注意生成内容的版权归属。
美图AI
美图公司推出的在线图片处理服务,集成了智能抠图、画质修复、老照片上色、人像美化与海报拼图等常见功能,多数操作在浏览器中完成,输入图片后即可预览效果并导出,适合没有专业修图经验、需要快速处理日常图片的用户。适合电商卖家、自媒体运营与普通用户做图片的快速美化与素材准备。需要注意的是,在线处理意味着图片需要上传到服务端,涉及未公开的产品图、证件与人物照片时应先确认平台的隐私政策,敏感图片建议使用本地软件处理;自动抠图与修复在复杂边缘、半透明物体上的效果有限,重要素材仍建议人工精修,导出分辨率与画质也受免费额度的限制。
Dalle Playground
DALL-E Playground 是一个开源的文生图实验项目,提供网页界面输入提示词并调用模型生成图像,可搭配不同后端运行,便于理解文生图模型对提示词的响应行为。适合做入门实验与教学演示,生成质量依赖所接入的模型,不适合直接用于对画质有要求的生产场景。
文心一格
百度推出的 AI 绘画平台,基于文心大模型,支持文生图、图生图、线稿上色与风格化处理,中文提示词理解较好,界面简单易上手。适合快速生成插画、海报素材与设计参考。平台提供免费额度,高清导出与商用授权按电量付费,是国内用户入门 AI 绘画的常见选择。
Big Sleep
Big Sleep 是 lucidrains 实现的文生图项目,结合 CLIP 与 BigGAN,通过优化潜向量让生成图像匹配文本描述,是早期文生图路线的代表性开源实现之一。代码精简适合研究原理与教学演示,生成质量与效率不及现代扩散模型,作为理解优化式文生图思路的样本很有价值。
Dragdiffusion
DragDiffusion 是发表于 CVPR 2024 的交互式图像编辑研究工作,在扩散模型上实现「拖拽点」式的局部编辑,把画面元素拖到目标位置并保持风格一致,仓库提供官方实现与使用说明。适合研究可控图像编辑的开发者,推理需要一定的显存与时间成本。
万相 Wan
阿里「通义」品牌已于 2026 年 3 月统一为千问 / Qwen,该视觉产品线现名「万相 Wan」。当前主力是 Wan3.0(2026 年 8 月上线),单次可原生生成 30 秒视频,输入支持文本、图像、音频、视频以及 doc、pdf、ppt 等文档格式。入口包括千问 App 和阿里云百炼,官网 wanxiang.aliyun.com。需要注意:官网提供免费体验额度,但 API 按量计费,早期「完全免费」的说法已不成立;Wan 系列历代模型在 GitHub、Hugging Face、魔搭等平台开源。适合需要中文语境下视频与图像生成的创作者。
即梦AI生图
字节跳动旗下的 AI 绘画工具,即梦平台内提供文生图、图生图与局部重绘能力,与剪映生态打通,生成风格贴近国内审美,中文提示词友好。适合海报素材、插画与短视频封面创作,提供免费额度,高清与商用导出按会员计费。
堆友AI
阿里巴巴设计团队推出的 AI 设计与 3D 素材平台,提供 AI 绘画、3D 素材下载、海报生成与电商设计模板等能力,风格贴近国内电商场景。适合设计师与运营快速产出素材,网页端可用,大部分素材免费可商用(逐项确认授权标注),另有付费专区。
Splikit
在线图片切割工具,一张图可切成九宫格或自定义多格网格,适合小红书、Instagram 的连续图文与电商详情页长图切块,免登录免费使用,输出保留原图分辨率与质量。纯前端处理,图片不上传服务器,隐私敏感素材也可放心使用。
Prolificdreamer
一种高保真、多样化的文本生成 3D 方法,发表于 NeurIPS 2023,主要面向研究与算法验证场景,可作为理解文生 3D 技术路线的参考。仓库提供论文与复现说明,适合有 3D 生成研究需求的开发者。需要注意的是,这类方法对算力与显存要求较高,实际复现成本不低,落地前建议先评估硬件条件与预期投入。
Stable Dreamfusion
文本或图像转 3D 网格的生成方案,输出的模型可导出用于后续编辑与渲染,主要面向研究与技术验证场景,适合需要了解文生 3D 实现方式的开发者参考。需要注意的是,该方案的生成耗时与算力开销较大,更适合研究与验证用途,落地生产前建议先评估硬件与时间成本。
Dreamgaussian
高效的 3D 内容生成方法,发表于 ICLR 2024,主打在较短时间内由图像生成 3D 资产,适合有 3D 生成研究或快速原型需求的技术人员参考其实现细节。需要注意的是,这类方法生成的模型细节精度有限,若用于正式项目通常还需后续修复与优化,建议先在小样本上验证。
Lgm
LGM(Large Multi-View Gaussian Model)是发表于 ECCV 2024 的 3D 内容生成方案,思路是用大规模多视图高斯表示,在较短时间内把文本或图像提示转成可渲染的 3D 资产。项目开放了论文与代码,主要面向研究与算法验证场景,也可作为理解高斯泼溅路线在 3D 生成中应用的参考。需要注意的是,这类研究型方案对显存与训练环境要求较高,复现成本不低,落地前建议先确认硬件条件与预期产出精度。
Instantmesh
InstantMesh 是一个单图生成 3D 网格的开源方案,思路是从一张图片出发快速重建出带贴图的 3D 模型,输出网格可直接导入常见建模与实时渲染流程。项目由腾讯 ARC 实验室开源,提供论文与代码,主要面向研究与算法验证场景,也适合需要快速做 3D 原型的技术人员参考实现细节。需要注意的是,单图重建对原图视角与遮挡情况较敏感,生成模型在薄结构与背面细节上通常需要人工修补,正式使用前建议先做小样本验证。
Hy Motion 1.0
HY-Motion 是腾讯混元团队推出的 3D 人体运动生成模型,用于根据文字描述生成角色动画动作,输出可用于 3D 角色驱动的运动数据。站内把它归入 3D 建模类,适合游戏开发、数字人与动画制作中需要快速获得动作草稿的场景。需要注意的是,生成的动作在物理合理性与风格细节上通常需要人工调整,正式用于项目前建议结合骨骼绑定做一次适配测试,确认与目标引擎的兼容性。
Mmdetection3D
MMDetection3D 是 OpenMMLab 推出的 3D 目标检测开源工具箱,面向点云与多模态数据,提供统一的训练、推理与评测流程,覆盖自动驾驶、机器人感知等场景中常见的检测算法实现,方便研究者复现与横向对比不同方法。适合做 3D 感知方向的研究人员与算法工程师。需要注意的是,该工具箱面向开发与研究,使用前需要熟悉其配置体系与依赖环境,实际部署还要结合具体传感器与数据格式做适配。
Zero123Plus
Zero123++ 是一个单图生成一致多视图的扩散模型,作为 3D 生成流程中的基础组件,能从一张输入图片推断出多个角度的一致视图,再交由后续算法重建为 3D 模型。项目开源发布,主要面向研究与算法验证场景,适合关注文生 3D、图生 3D 技术路线的开发者参考其实现方式。需要注意的是,多视图推断的一致性有限,纹理细节与不可见区域的重建质量依赖输入图片与后续步骤,实际使用前建议先做小样本测试。
Objaverse Xl
Objaverse-XL 是一个大规模 3D 对象数据集,收录超过 1000 万个 3D 资产,覆盖多种类别与来源,用于训练与评测 3D 生成、理解与检索类模型。适合需要大规模 3D 数据做训练或基准测试的研究团队与算法开发者。需要注意的是,数据集内的资产来源多样,许可与商用条件并不统一,直接用于商业产品或二次分发前需逐项确认授权;数据集体量较大,下载与存储也需要相应准备。
Hunyuanworld 1.0
腾讯混元团队推出的 3D 世界生成项目,可依据文字描述或像素图生成可探索的 3D 场景,面向游戏原型、虚拟场景搭建与沉浸式内容创作等场景。站内把它归入 3D 建模类,适合希望快速产出可漫游场景草稿、而不想从零搭建地形的开发者与创作者。需要注意的是,生成场景在细节精度与物理合理性上通常需要后续加工,正式项目使用前建议先在目标引擎中测试导入效果与性能表现。
3Dcellforge
一个开源的 3D 模型生成与展示工具,站内描述其定位为交互式的 3D 创作工作台,可结合 AI 能力生成模型并直接在浏览器中查看与调整,适合做模型预览、快速原型与技术验证。项目在 GitHub 上开放源码。需要注意的是,这类早期项目在功能完整度与稳定性上仍在演进,正式项目使用前建议先确认其依赖环境与输出格式是否满足需求,并为后续可能的接口变更留出适配成本。
Trellis.2
TRELLIS 系列的第二代 3D 生成方案,由微软相关团队开源,核心思路是在结构化的潜空间中对 3D 资产进行表示与生成,可用文字或图像提示产出带结构信息的 3D 模型,输出便于后续编辑与渲染。主要面向研究、算法验证与需要自建生成能力的技术团队。需要注意的是,这类研究型方案对显存与运行环境要求较高,从代码到可用服务之间还有较大的工程化工作量,落地前建议先评估硬件投入与团队适配成本。
Wonder3D
Wonder3D 是一个单图生成 3D 的开源方案,通过跨域扩散模型在生成多视图图像的同时产出对应法线信息,再据此重建出带纹理的 3D 网格,思路对理解图生 3D 的一致性保持有参考价值。项目提供论文与代码,主要面向研究与算法验证场景。需要注意的是,单图重建对输入图片的视角与遮挡情况敏感,生成模型在复杂结构上需要人工修补,实际使用前建议先用多组图片测试重建质量。
Worldgen
WorldGen 是一个由文本生成 3D 场景的开源方案,主张在较短时间内产出可探索的场景,思路是先由文字生成全景表示再重建为三维场景,可用于理解大尺度场景生成的技术路线,适合研究与原型验证场景。项目在 GitHub 开放源码。需要注意的是,这类方案的产出在几何精度与纹理细节上通常比较粗糙,生成耗时与硬件条件密切相关,作为正式项目资产前一般还需经过重建与清理流程。
Threestudio
threestudio 是一个统一的 3D 内容生成研究框架,把基于分数蒸馏(SDS)等路线的多种方法整合到同一套训练与推理代码中,便于研究者对比不同算法、快速复现论文实验。适合做 3D 生成方向研究、需要统一实验环境的开发者。项目开源并持续更新。需要注意的是,该框架面向研究用途,依赖较重且训练对显存要求较高,从研究代码到稳定服务还有较大的工程化距离,落地前建议评估硬件与维护成本。
Partcrafter
面向结构化 3D 生成的学术开源项目,采用按部件分解的思路,从图像生成带独立结构的 3D 网格,便于后续对单个部件做编辑、替换与装配。论文发表于 NeurIPS 2025,代码与权重已在项目主页开放,适合研究者与建模人员学习其生成流程并做二次实验。需要注意的是,此类研究项目的工程完整度通常有限,输出网格在拓扑质量与细节上可能仍需修复,正式用于生产前建议先在目标引擎中测试导入与渲染效果。
Unique3D
从单张图片重建 3D 网格的学术开源项目,可生成带贴图的物体模型,生成速度相对较快,适合为资产库快速补充原型模型或做概念验证。论文发表于 NeurIPS 2024,代码与权重已开放,适合研究者与建模人员学习与二次开发。需要注意的是,单图输入能提供的信息有限,模型对遮挡区域与背面细节主要依靠推断,复杂结构或细长部件容易出现形变,正式用于项目前建议先检查网格质量并按需精修。
Trellis
由研究团队开源的大规模 3D 生成模型,采用结构化潜空间表示来统一处理不同输出格式,可从单张图片生成带材质的三维资产,在几何与外观一致性上做了针对性设计。论文发表于 CVPR,代码与模型权重已开放,适合研究者与 3D 内容创作者试用其生成流程。需要注意的是,生成资产的网格密度与拓扑通常不适合直接用于影视级生产,导入引擎前建议做减面与修复,显存占用也需按本机配置评估。
Dreamcraft3D
从单张图片生成三维物体的开源项目,采用分层式思路先构建几何再补充纹理,输出带贴图的 3D 网格,在细节表现上做了针对性优化。论文发表于 ICLR,代码已开放,适合研究者与建模人员参考其生成流程并做二次实验。需要注意的是,此类研究项目在运行环境与依赖版本上较为敏感,复现可能需要一定工程投入;生成网格的拓扑与面数不一定适合直接进生产管线,导入引擎前建议做修复与减面。
Hunyuan3D 2
腾讯推出的 3D 资产生成模型,支持从文本或图片生成带贴图的网格模型,在几何细节与纹理质量上较上一代有明显提升,并提供在线体验与开放接口,可用于游戏原型、电商展示与概念设计等场景快速补充资产。适合需要快速获得三维素材的创作者与中小团队。需要注意的是,生成模型的网格拓扑不一定满足生产管线要求,导入引擎前通常需要清理与减面;商用范围与生成内容的权属按官方条款界定,正式投放前建议确认。






