Что именно скачивается
Модель на Hugging Face — это репозиторий с файлами: веса (обычно .safetensors или .gguf), конфигурация, токенизатор и описание. Большие модели разбиты на несколько файлов весов, поэтому скачивать по одному кнопкой неудобно.
Прежде чем качать, откройте вкладку Files and versions и посмотрите размер: модели на 7–8 млрд параметров весят около 15 ГБ в полной точности и 4–5 ГБ в квантованном GGUF.
Способ 1: через браузер
Откройте страницу модели
На huggingface.co найдите модель поиском.
Перейдите в Files and versions
Здесь лежат все файлы репозитория.
Скачайте нужный файл
Нажмите значок загрузки рядом с файлом. Для GGUF обычно достаточно одного файла нужного квантования.
Способ 2: командой hf download
Официальная утилита теперь называется hf, прежняя команда huggingface-cli устарела. Установить её можно командой pip install -U huggingface_hub или установщиком с сайта Hugging Face для Windows, macOS и Linux.
Весь репозиторий модели скачивается командой hf download имя-автора/имя-модели. Один файл — hf download gpt2 config.json. В свою папку — с ключом --local-dir, например hf download адрес-модели --local-dir models. Если загрузка прервалась, повторный запуск докачает только недостающее.
Датасеты и закрытые модели
- датасет качается той же командой с ключом --repo-type dataset
- для закрытых моделей (gated) сначала примите лицензию на странице модели
- затем войдите командой hf auth login и вставьте токен из настроек аккаунта
- из Python подойдёт функция snapshot_download из библиотеки huggingface_hub
Если скачивание не идёт
Ошибка 401 или 403 чаще всего означает, что не принята лицензия модели или не выполнен вход с токеном. Медленная загрузка больших файлов — повод включить ускоренный режим загрузки из документации huggingface_hub или качать ночью. Место на диске проверяйте заранее: кэш по умолчанию лежит в папке пользователя, в .cache/huggingface.
Какой файл GGUF выбрать
В репозиториях GGUF обычно лежит десяток файлов одной модели с разным квантованием. Чем меньше число после Q, тем меньше файл и ниже качество. Золотая середина для домашнего ПК — Q4_K_M: потеря качества почти незаметна, а размер в 3–4 раза меньше полного.
Q8_0 почти не отличается от оригинала, но требует вдвое больше памяти. Q2 и Q3 стоит брать, только если иначе модель совсем не влезает: ответы заметно глупеют.
Куда деваются скачанные файлы
По умолчанию hf download и библиотеки кладут файлы в общий кэш, чтобы разные программы не качали одну модель дважды. Это удобно, но кэш быстро разрастается до сотен гигабайт. Посмотреть и почистить его можно командами hf cache — они покажут, какие модели занимают больше всего места.
Если модель нужна конкретной программе, например ComfyUI или LM Studio, качайте сразу в её папку через --local-dir.
Когда быстрее через ИИ-агента
Часто модель качают ради одного результата: расшифровать запись, перевести текст, сделать картинку. ИИ-агент LeanTech сам подберёт подходящую нейросеть, выполнит задачу и отдаст файл — DOCX, XLSX, PNG или MP3. Ничего не нужно скачивать и ставить, оплата картой РФ.
Чего агент не делает: не скачивает веса моделей на ваш компьютер и не устанавливает софт. Зато напишет команду или скрипт для скачивания, если модель нужна именно локально.