使用blip2进行图片输入文本输出

news2026/2/15 22:31:49

多模态的重要模型blip2,官方提供模型可以直接用来图片生成文本
github地址：https://github.com/salesforce/LAVIS/tree/main/projects/blip2

个人相当于跑了一下blip2的demo，记录下过程，供今后需要参考：
1、首先是环境安装，跟着官网走：https://github.com/salesforce/LAVIS/tree/7f00a0891b2890843f61c002a8e9532a40343648#installation
在这里插入图片描述
其中，salesforce-lavis我装的时候遇到了问题，可能是服务器网络问题，如果安装有问题，可以尝试pypi下载压缩包进行安装：
pypi网址：https://pypi.org/project/salesforce-lavis/

在这里插入图片描述
安装命令：

pip install salesforce-lavis-1.0.2.tar.gz

期间如果提示缺什么库，按要求装上就可以了
我装的版本：

conda install pytorch==1.10.0 torchvision==0.11.0 torchaudio==0.10.0 cudatoolkit=11.1 -c pytorch
pip install salesforce-lavis
cd /.../.../LAVIS-main/
pip install -e .
pip install accelerate

期间碰到了transformer的问题，从transformer库导入有问题，我降低了版本，我目前的版本是
transformer==4.35.2

环境装完后，需要下载blip2的模型：
网址：https://huggingface.co/models?other=blip-2
在这里插入图片描述
一般是下载上面这个模型，也有其他的可以下载，
具体网址：https://huggingface.co/Salesforce/blip2-opt-2.7b/tree/main

把上面页面中的所有文件下载下来，放到blip2的工作空间中
然后就可以跑官方提供的demo了。

from PIL import Image
import requests
from transformers import Blip2Processor, Blip2ForConditionalGeneration
import torch

device = "cuda" if torch.cuda.is_available() else "cpu"

processor = Blip2Processor.from_pretrained("my_blip2/blip2-opt-2.7b")
model = Blip2ForConditionalGeneration.from_pretrained(
    "my_blip2/blip2-opt-2.7b", torch_dtype=torch.float16
)
model.to(device)
url = "http://images.cocodataset.org/val2017/000000039769.jpg"
image = Image.open(requests.get(url, stream=True).raw)

inputs = processor(images=image, return_tensors="pt").to(device, torch.float16)

generated_ids = model.generate(**inputs)
generated_text = processor.batch_decode(generated_ids, skip_special_tokens=True)[0].strip()
print(generated_text)

上面的image可以换成自己的图片：

imgfile = '../../xxx.jpg'
image= Image.open(imgfile).convert('RGB')

或者根据个人需求改成批量化生成文本的代码也可以

本文来自互联网用户投稿，该文观点仅代表作者本人，不代表本站立场。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如若转载，请注明出处：http://www.coloradmin.cn/o/1313001.html

如若内容造成侵权/违法违规/事实不符，请联系多彩编程网进行投诉反馈，一经查实，立即删除！

使用blip2进行图片输入文本输出

相关文章

Spring上下文之注解模块ConfigurationMethod

如何实现免费的文档翻译

【力扣】19. 删除链表的倒数第 N 个结点

接口返回HTML页面详解

批量解压imagenet1k数据集中的zip文件

拆解大语言模型 RLHF 中的PPO算法

11月，1Panel开源面板项目收到了这些评论

【思考】只有实对称矩阵才能正交对角化吗？【矩阵的合同】

stm32项目（12）——基于stm32f407zgt6的频率计设计

Python语言学习笔记之十一（DotEnv）

科研论文中PPT图片格式选择与转换：EPS、SVG 和 PDF 的比较

VR智慧眼：为各行业打造3D数字化业务协同平台

SQL Server数据库使用T-SQL语句简单填充

【项目管理】CMMI对项目管理有哪些个人启发和思考

【Spring Boot】Starter机制的使用及案例

7+m6A+分型+实验，甲基化方向的生信思路，没有思路的同学可参考

Notes Domino 14.0正式版发布

基于Java的在线教育平台设计与实现论文

人工智能如何改变未来的教育

机器学习---音乐分类案例