发布于 2026-01-05 0 阅读
0

如何使用 Python 和 Hugging Face 在本地运行 Llama-3.1🦙 🤗

如何使用 Python 和 Hugging Face 在本地运行 Llama-3.1🦙 🤗

介绍

最新的 Llama🦙(大型语言模型 Meta AI)3.1 是由 Meta AI 开发的一款强大的 AI 模型,在自然语言处理 (NLP) 领域引起了广泛关注。它是迄今为止功能最强大的开源 LLM。在本博客中,我将指导您如何从 Hugging Face🤗 克隆 Llama 3.1 模型,并使用 Python 在本地计算机上运行它。之后,您可以将其集成到任何 AI 项目中。


先决条件

  • 本地计算机上已安装 Python 3.8 或更高版本。
  • Hugging Face Transformers 库已安装(pip install transformers
  • Git 已安装在您的本地计算机上。
  • 拥抱脸账号

步骤 1:获取模型访问权限

Meta-llama-3.1-8b-指导拥抱脸模型

  • 一开始你应该看到这样的画面:

Meta-llama-3.1-8b-指令模型

  • 请提交以下表格以获取模型访问权限

访问 Metallama 3.1 模型

  • 一旦看到“您已获得此模型的访问权限”,就可以开始操作了……

拥抱脸部的门控模型

步骤 2:创建 ACCESS_TOKEN

  • 前往“设置”(如下图右下角):

拥抱脸部设置

  • 转到“访问令牌”,点击“创建新令牌”(图像右上角):

制作拥抱脸代币

  • 授予读写权限,并选择如下所示的存储库:

制作拥抱脸代币

  • 复制令牌并将其保存在安全的地方,因为将来会用到。(注意:一旦复制就无法再次复制,所以如果您忘记了密钥,则必须重新创建一个新的令牌。)

拥抱脸代币


步骤 3:克隆 LLaMA 3.1 模型

现在,请在您常用的终端上运行以下命令。
其中ACCESS_TOKEN,是您复制的命令,而是<huggingface-user-name>您的 Hugging Face 账号的用户名。



git clone https://<huggingface-user-name>:<ACCESS_TOKEN>@huggingface.co/meta-llama/Meta-Llama-3.1-8B-Instruct


Enter fullscreen mode Exit fullscreen mode

这可能需要很长时间,具体取决于您的网络速度。

第四步:安装所需库

克隆完成后,进入克隆的文件夹并安装所有依赖项。(您可以使用 conda(推荐requirements.txt)或 virtualenv创建虚拟环境 您可以在我提供的 GitHub 仓库中找到 requirements 文件,该文件位于下面的资源部分。

使用conda



cd Meta-Llama-3.1-8B-Instruct
conda install --yes --file requirements.txt


Enter fullscreen mode Exit fullscreen mode

使用pip



cd Meta-Llama-3.1-8B-Instruct
pip install -r requirements.txt


Enter fullscreen mode Exit fullscreen mode

步骤 5:运行 Llama 3.1 模型

创建一个新的 Python 文件(例如 test.py),并将您刚刚克隆的模型仓库的路径粘贴到该文件中model_id(例如,`/etc/models/ "D:\\Codes\\NLP\\Meta-Llama-3.1-8B-Instruct"`)。以下是一个示例:



import transformers
import torch

## Here you paste your cloned repos location
model_id = "D:\\Codes\\NLP\\Meta-Llama-3.1-8B-Instruct" 

pipeline = transformers.pipeline(
    "text-generation",
    model=model_id,
    model_kwargs={"torch_dtype": torch.bfloat16},
    device_map="auto",
)

messages = [
    {"role": "user", "content": "Who are you?"},
]

outputs = pipeline(
    messages,
    max_new_tokens=256,
)
print(outputs[0]["generated_text"][-1])


Enter fullscreen mode Exit fullscreen mode

您还可以设置device_map=cuda是否同时使用GPU。

步骤 6:运行 Python 脚本



python test.py

Enter fullscreen mode Exit fullscreen mode




输出

llama-3.1 输出


您可能面临的问题

  • OSError: [WinError 126] fbgemm.dll
    • 要解决此错误,请确保已安装Visual Studio
      • 如果您还没有安装,请点击这里进行安装。
      • 然后重启电脑。
  • 如果 pytorch 版本仍然存在任何错误,请使用anacondaminiconda配置具有合适 python 版本和依赖项的新环境。
  • 如果您遇到任何其他问题或错误,请随时在下方留言。

资源

有关 llama 3.1 的更多详细信息,请访问:https://ai.meta.com/blog/meta-llama-3-1/

我的实现:https://github.com/Debapriya-source/llama-3.1-8B-Instruct.git


结论

在本篇博客中,我们成功地从 Hugging Face 克隆了 LLaMA-3.1-8B-Instruct 模型,并使用 Python 在本地机器上运行了它。现在,您可以修改提示符、调整超参数或将其集成到您即将开展的项目中,从而对该模型进行实验。祝您编码愉快!

文章来源:https://dev.to/debapriyadas/cloning-and-running-llama-31-model-from-hugging-face-using-python-3m80