多场景PAI-Diffusion中文模型家族大升级,12个模型、2个工具全部开源

news2024/12/28 19:34:03

作者: 段忠杰、刘冰雁、汪诚愚、邹心怡、黄俊

概述

在过去几年中,随着AI生成内容(AI Generated Content,AIGC)的快速发展,Stable Diffusion模型在该领域崭露头角。阿里云机器学习PAI团队为推动这一领域的发展,参考了Stable Diffusion的模型结构,结合中文语言的特点,通过大量对模型预训练数据的处理和过滤,以及训练过程的优化,提出了PAI-Diffusion中文文图生成模型,实现了图像生成质量的大幅提升和风格多样化。PAI-Diffusion模型的Pipeline不仅包含了标准的Diffusion Model,还集成了中文CLIP跨模态对齐模型,使得模型能够生成符合中文文本描述的各种场景下的高清大图。此外,我们也推出了PAI的自研Prompt美化器BeautifulPrompt,赋能Stable Diffusion类应用一键出美图。

我们在这次的工作中,将PAI-Diffusion中文模型家族扩展到多种应用场景,支持文生图、文图生图、图像修复、LoRA、ControlNet等多种常见功能。为了更好地与开源社区互动,我们将12个PAI-Diffusion中文模型(包括基础模型、LoRA、ControlNet等)全部开源,并支持用户自由下载和使用,与开发者一起共同推动AI生成内容技术的发展,创造出更有创意和影响力的作品。此外,PAI-Diffusion中文模型对应两个推理工具也在开源社区推出。其中,Chinese Diffusion WebUI作为Stable Diffusion WebUI的插件与PAI-EAS无缝兼容,支持5分钟内一键在PAI-EAS拉起中文AIGC应用;Diffusers-API也完美支持中文模型的快速部署和推理。

在下文中,我们详细介绍PAI-Diffusion中文模型家族及其工具Chinese Diffusion WebUI和Diffuser-API的使用。

多场景的PAI-Diffusion中文模型家族

我们利用海量中文图文对数据,训练了如下12个模型,包括基础模型、LoRA、ControlNet等,模型列表如下:

在这里插入图片描述

上述所有模型都可以在我们的Hugging Face Space进行下载,我们的模型也可以通过ModelScope进行调用。模型生成的效果如下所示:

在这里插入图片描述

下面给出了三个PAI-Diffusion中文模型的应用场景:

应用场景一:输入草稿图和对应的Prompt,生成精细的艺术图画。

在这里插入图片描述

应用场景二:污染破损的古诗词绘画图像的修复,即image in-painting。

在这里插入图片描述

应用场景三:为国风游戏绘制中国古代室内场景。

在这里插入图片描述

为了尽可能提升模型输出图像的质量,我们搜集海量开源的图文对数据集,包括大规模中文跨模态预训练数据集WuKong、大规模多语言多模态数据集LAION-5B等。此外,我们也搜集了大量不同领域、不同场景的数据集,用于扩展PAI-Diffusion中文模型家族的应用场景。我们针对图像和文本进行了多种清洗方式,筛选掉低质量数据。具体的数据处理方式包括NSFW(Not Safe From Work)数据过滤、水印数据去除,我们也使用CLIP分数和美观值分数评分,过滤CLIP分数和美观值分数较低的数据,保证生成图像的语义一致性和质量。为了适配中文语义场景,我们的CLIP Text Encoder采用EasyNLP自研的中文CLIP模型(https://github.com/alibaba/EasyNLP)进行建模,使得模型更懂中文语言。

PAI-Diffusion中文模型部署工具

本节详细介绍PAI-Diffusion中文模型对应的两个开源工具。Chinese Diffusion WebUI作为插件与PAI-EAS无缝兼容,支持5分钟内一键拉起中文AIGC应用;Diffusers-API通过API形式支持中文模型的快速部署和推理。

Chinese Diffusion WebUI

由于Stable Diffusion WebUI无法原生支持中文模型,我们开发了Chinese Diffusion WebUI,作为Stable Diffusion WebUI的插件提供给用户。它提供了图形划的用户界面,使用户(尤其是没有编程经验的设计师)可以使用PAI-Diffusion中文模型的多种功能,例如文生图、图生图、图像风格迁移、图像编辑等。Chinese Diffusion WebUI的界面如下图所示:

在这里插入图片描述

在这里插入图片描述

为了方便用户在PAI-EAS上使用Chinese Diffusion WebUI,我们的插件也支持了两种模式:单机版本和集群版本,用户可以根据需求和资源选择不同的模式。在单机版中,用户在独占的节点上使用Chinese Diffusion WebUI,特别方便个人设计师的使用。集群版利用PAI的弹性推理服务,实现并行处理,高效利用和共享计算资源,从而实现了更高的资源利用率。

此外,Chinese Diffusion WebUI也可以在非PAI-EAS环境下使用,用户只需要在下载Chinese Diffusion WebUI插件,放置在标准Stable Diffusion WebUI的插件目录下就可以实现本地的使用了。

Diffusers-API

Diffusers-API是阿里云机器学习PAI团队开源的、基于Diffusers的文图生成云服务SDK。用户可以直接基于本项目提供的镜像,在PAI-EAS上部署各种Diffusion相关服务,例如文生图、图生图、LoRA、ControlNet等。Diffusers-API还基于PAI-Blade对模型进行了推理优化,降低推理流程的端到端延迟 2.3 倍,同时可显著降低显存占用,超过TensorRT-v8.5等业内SOTA优化手段。

在Diffusers-API中,我们使用StableDiffusionLongPromptWeightingPipeline作为默认的推理接口,以支持带有权重的、无长度限制的英文Prompt。然而,Diffusers默认的推理接口无法无缝支持中文文本的处理。我们扩展了StableDiffusionLongPromptWeightingPipeline,根据载入模型的Text Encoder,自动检测语言,并且进行适配,使得无需修改Diffusers-API的任何接口的条件下,支持社区Stable Diffusion和PAI-Diffusion中文模型的一键部署,其HTTP请求体示例如下:

{ 
"task_id" : "001",  
"prompt": "一只可爱的小猫咪",  
"negative_prompt": "模糊", 
"cfg_scale": 7,
"steps": 25,
"image_num": 1,
"width": 512, 
"height": 512,
"use_base64": True
}

部署PAI-Diffusion中文模型的步骤详见这里。

总结

通过先前的PAI-Diffusion中文模型的开源,我们成功提升了图像生成质量和风格多样化,并实现了中文文本描述下各种场景的高清大图生成。此外,我们还推出了自研的Prompt美化器BeautifulPrompt,为Stable Diffusion类应用提供了一键美图的能力。在本次的工作中,我们不仅将PAI-Diffusion中文模型家族扩展到多种应用场景,还全面开源了12个PAI-Diffusion中文模型,包括基础模型、LoRA、ControlNet等。我们的工作希望为开发者们提供更多的创作可能性和创新机会,共同推动AI生成内容技术的发展,创造出更有创意和影响力的作品。此外,我们还推出了两个开源工具,Chinese Diffusion WebUI和Diffuser-API,提供便捷的使用体验。Chinese Diffusion WebUI作为插件与PAI-EAS无缝兼容,支持用户在5分钟内快速搭建中文AIGC应用;而Diffusers-API则完美支持中文模型的快速部署和推理。我们期待与开发者们共同推动AI生成内容技术的前进。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/1004393.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

三、日志编写 —— TinyWebServer

日志编写 —— TinyWebServer 一、 前言 上期已经写完lock类的编写。这期是日志的编写。 对于日志需要弄懂几个基本概念才可以更好的理解和编写日志。 什么是日志?常用的日志级别有哪些?日志的基本格式是什么?异步日志类刷新缓冲区的作用同…

爱尔眼科周进院长出席CCOS 2023并担任学术讲者及培训导师

星城长沙,大咖云集,护航光明,共创未来!9月6日—10日,国内眼科学界最盛大的学术会议——中华医学会第二十七次全国眼科学术大会(CCOS 2023)在湖南长沙隆重举办!逾万名国内外眼科专家、学者代表参加盛会,聚焦眼科发展的新…

骨传导耳机弊端都有哪些?盘点骨传导耳机有哪些缺点!

骨传导耳机有弊端吗?答案是有的!不过由于骨传导耳机的优点大于缺点,所以骨传导耳机的弊端可以忽略不计,下面跟大家说下骨传导耳机都有什么弊端。 1、漏音情况 不管什么耳机,都会存在漏音情况,只是漏音的…

恒运资本:早盘三大指数震荡 减肥药概念再度大涨!

周二(9月12日),A股三大股指震动,涨跌互现。到上午收盘,上证指数涨0.04%,报3144.03点;深证成指涨0.32%,报10415.22;创业板指跌0.10%;沪深两市算计成交额4492.47亿元&#…

C++ 特性模版

目录 1. 非类型模板参数 2. 模板的特化 2.1 概念 2.2 函数模板特化 2.3 类模板特化 2.3.1 全特化 2.3.2 偏特化 2.3.3 类模板特化应用示例 3 模板分离编译 3.1 什么是分离编译 3.2 模板的分离编译 3.3 解决方法 4. 模板总结 1. 非类型模板参数 模板参数分类类型形…

【SpringCloud微服务项目实战-mall4cloud项目(2)】——mall4cloud-gateway

mall4cloud-gateway网关模块 系统架构与网关介绍网关介绍 网关层代码依赖引入bootstrap配置nacos配置gateway配置处理跨域问题gateway路由断言配置gateway路由过滤配置 总结 代码地址 github地址 fork自github原始项目 gitee地址 fork自gitee原始项目 系统架构与网关介绍 从图…

企业为什么要做网络安全?

网络安全任何人都无法独善其身,无论个个人还是企业或者是高校、机构等,都需要参与到网络安全维护中。 在当今数字化时代,随着互联网的普及和企业信息化程度的提高,网络安全成为了企业运营中不可忽视的重要问题。网络安全指的是通过…

浅谈限流式保护器在高校防火工作的应用

安科瑞 华楠 【摘要】摘要:为了预防火灾和减少火灾带来的危害,保护校园和师生生命财产安全, 建和谐安宁的校园环境,保障学校安全稳定发展,我们必须要时刻拧紧消防安全这弦,时刻注意这根高压线。随着近年来…

RFID标签:实现固定资产全生命周期管理与极速盘点的利器

随着企业规模的扩大和业务的发展,固定资产管理变得越来越重要。然而,传统的手工管理方式往往效率低下、容易出错,无法满足现代企业对高效、准确管理的需求。在这样的背景下,RFID(Radio Frequency Identification&#…

C++项目实战——基于多设计模式下的同步异步日志系统-⑦-日志输出格式化类设计

文章目录 专栏导读日志格式化类成员介绍patrernitems 格式化子项类的设计抽象格式化子项基类日志主体消息子项日志等级子项时间子项localtime_r介绍strftime介绍 源码文件名子项源码文件行号子项线程ID子项日志器名称子项制表符子项换行符子项原始字符串子项 日志格式化类的设计…

2100. 适合打劫银行的日子;2080. 区间内查询数字的频率;1774. 最接近目标价格的甜点成本

2100. 适合打劫银行的日子 核心思想:枚举前后缀。我们只需要预处理到第i天的前后缀,然后枚举一边i即可。最开始的时候我是分开求前后缀的,这里可以把前后缀一起进行处理。 2080. 区间内查询数字的频率 核心思想:二分。其实有一种…

Postman抓包网页请求

安装postman Interceptor谷歌插件 1.点击软件右下角Capture 2.启用代理 设置端口 3.手动点开谷歌插件,开始获取 4.获取结果可以点击进入详情页,查看接口信息

通过Python行命令搭建HTTP服务器结合内网穿透实现外网访问

文章目录 1.前言2.本地http服务器搭建2.1.Python的安装和设置2.2.Python服务器设置和测试 3.cpolar的安装和注册3.1 Cpolar云端设置3.2 Cpolar本地设置 4.公网访问测试5.结语 1.前言 Python作为热度比较高的编程语言,其语法简单且语句清晰,而且python有…

Vue项目中全局变量process的用法解析

一、什么是process process对象是一个全局变量,提供了有关当前Node.js进程的信息并对其进行控制。常用于Vue项目中环境区分,对不同环境的配置不同,例如:根据全局变量区分请求的url地址、是否开始eslint、不同环境的特殊配置等等。…

AiDB: 一个集合了6大推理框架的AI工具箱 | 加速你的模型部署

首发于GiantPandaCV公众号 项目地址: https://github.com/TalkUHulk/ai.deploy.box 网页体验: https://www.hulk.show/aidb-webassembly-demo/ PC: https://github.com/TalkUHulk/aidb_qt_demo Android: https://github.com/TalkUHulk/aidb_android_demo Go Server: https://gi…

[ Linux Audio 篇 ] 音频软件 Audacity 指导手册

音频软件 Audacity 指导手册 背景修订记录双声道提取到单声道查看频响特性查看增益导出Raw数据与作者沟通 背景 对于经常调试音频的开发人员来说,使用Audacity分析音频数据已经成为家常便饭。尤其对于日常使用Ubuntu / Linux等操作系统的开发人员来说,拥…

从构建者到设计者的低代码之路

低代码开发技术,是指无需编码或通过少量代码就可以快速生成应用程序的工具,一方面可降低企业应用开发人力成本和对专业软件人才的需求,另一方面可将原有数月甚至数年的开发时间成倍缩短,帮助企业实现降本增效、灵活迭代。那么&…

华为HCIA学习(一)

文章目录 一.根据考试题总结知识点(一题一点)二.上午学习三.下午学习四.今天只做了70题,需要的可以找我 一.根据考试题总结知识点(一题一点) 二.上午学习 ① VRP系统是VRP是华为公司从低端到高端的全系列路由器、交换…

MySQL数据库20G数据迁移至其他服务器的MySQL库或者云MySQL库

背景:20G的MySQL数据迁移至火山云MySQL库,使用navicat的数据传输工具迁移速度耗费时间过长。 方案一:使用火山云提供的MySQL数据迁移服务(其他大厂应该提供的也有) 方案二:使用数据迁移工具kettle&#x…

【记录贴】使用项目管理软件管理大型复杂项目是种什么体验?

随着手上的几个项目陆续验收交付,现在我又接了一个新项目,这次是一个中大型的软件开发项目。大型项目具有规模大、周期长、团队成员构成复杂、影响因素多等特征,所以我在项目推进过程中遇到了很多困难,想跟大家分享交流下&#xf…