Windows CPU部署llama2量化模型并实现API接口

news2025/4/5 1:13:17

模型部署

从huggingface下载模型
https://huggingface.co/
放在本地文件夹，如下
在这里插入图片描述

本地运行llama2

from ctransformers import AutoModelForCausalLM

llm = AutoModelForCausalLM.from_pretrained("D:\llm\llama2\models\llama2-7b-chat-ggml", model_file = 'llama-2-7b-chat.ggmlv3.q3_K_S.bin')

print(llm('<s>Human: 介绍一下中国\n</s><s>Assistant: '))

使用fastapi实现API接口

服务端

import uvicorn
from fastapi import FastAPI
from pydantic import BaseModel
from ctransformers import AutoModelForCausalLM
# 参考 https://blog.csdn.net/qq_36187610/article/details/131835752

app = FastAPI()

class Query(BaseModel):
    text: str

@app.post("/chat/")
async def chat(query: Query):
    input = query.text 
    llm = AutoModelForCausalLM.from_pretrained("D:\llm\llama2\models\llama2-7b-chat-ggml", model_file = 'llama-2-7b-chat.ggmlv3.q3_K_S.bin')
    output = llm('<s>Human: ' + input + '\n</s><s>Assistant: ')
    print(output)   
    return {"result": output}
    
if __name__ == "__main__":
    uvicorn.run(app, host="0.0.0.0", port=6667)

客户端

import requests

url = "http://192.168.3.16:6667/chat/"  # 注意这里ip地址不能使用0.0.0.0,而是使用实际IP地址，通过ipconfig可以查看
query = {"text": "你好，请做一段自我介绍，使用中文回答，不能超过100个字。"}

response = requests.post(url, json=query)

if response.status_code == 200:
    result = response.json()
    print("BOT:", result["result"])
else:
    print("Error:", response.status_code, response.text)

常用git仓库

https://github.com/marella/ctransformers
https://github.com/FlagAlpha/Llama2-Chinese
https://github.com/tiangolo/fastapi

本文来自互联网用户投稿，该文观点仅代表作者本人，不代表本站立场。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如若转载，请注明出处：http://www.coloradmin.cn/o/1348863.html

如若内容造成侵权/违法违规/事实不符，请联系多彩编程网进行投诉反馈，一经查实，立即删除！

Windows CPU部署llama2量化模型并实现API接口

目录

模型部署

本地运行llama2

使用fastapi实现API接口

常用git仓库

相关文章

【Python】ubuntu python＞3.9编译安装，及多个Python版本并存的使用方法

2023下半年的总结

FPGA项目（14）——基于FPGA的数字秒表设计

【ROS2】MOMO的鱼香ROS2（三）ROS2入门篇——ROS2第一个节点

2024新版塔罗占卜网站源码风水起名附带搭建视频及文本教程

力扣-206. 反转链表

【形式语言与自动机/编译原理】CFG--＞Greibach--＞NPDA（2）

【大数据Hive】hive 运算符使用详解

Airtest的iOS实用接口介绍

互联网大厂面试题目

UG装配-接触对齐

innovus：refresh CTS

爬取豆瓣电影评论内容、星级、评论时间、支持人数

Node.js+Express+Mysql 极简代码实现对数据库增删改查的Restful API服务

如何解决企业内部FTP文件传输速度过慢和安全问题

软件测试/测试开发丨Linux 三剑客与管道使用

【华为机试】2023年真题B卷（python）-喊七的次数重排

第一节初始化项目

Pearson correlation coefficient (Pearson’s r) 皮尔森相关系数

Pycharm 切换interpreter---python的环境和第三方库问题