Сначала проверьте, что модель вам по силам
Языковой модели на 7–8 млрд параметров в квантованном виде хватает 8 ГБ видеопамяти или 16 ГБ оперативной памяти — работать будет, но медленно. Модели на десятки миллиардов параметров на домашнем ПК запускают только в сильном квантовании.
Смотрите на карточку модели: там указаны формат, лицензия и примеры запуска. Кнопка Use this model на странице модели сразу показывает готовые команды для популярных программ.
Путь 1: Ollama — одна команда
Установите Ollama
Скачайте программу с ollama.com для Windows, macOS или Linux.
Найдите модель в GGUF
На Hugging Face отфильтруйте модели по библиотеке GGUF.
Запустите
Команда ollama run hf.co/автор/репозиторий скачает и запустит модель. По умолчанию берётся квантование Q4_K_M, другое задаётся через двоеточие, например :Q8_0.
Путь 2: Python и Transformers
Для разработчиков основной путь — библиотека transformers. Установите её вместе с torch, затем создайте конвейер: pipeline('text-generation', model='автор/модель'). При первом запуске веса скачаются в кэш, дальше модель загружается с диска.
Для картинок используют библиотеку diffusers, для речи — те же transformers с моделями распознавания. Без видеокарты NVIDIA всё работает, но в разы медленнее.
Путь 3: Spaces — без установки
Многие модели уже упакованы в демо-приложения Spaces: открываете страницу и пользуетесь в браузере. Бесплатные Spaces работают в очереди и засыпают без посетителей, первый запуск может занять минуту-другую. Подписка Pro за 9 $ в месяц увеличивает квоту ZeroGPU, но российской картой её не оплатить.
Частые ошибки
- CUDA out of memory — модель не влезла в видеокарту, берите квантованную версию
- 401 при загрузке — модель закрытая, нужна лицензия и вход с токеном
- модель отвечает бессвязно — неверный шаблон чата или базовая модель вместо instruct
- всё очень медленно — модель работает на процессоре, а не на видеокарте
Как выбрать модель для запуска
Для первой пробы берите популярную instruct-модель на 3–8 млрд параметров в GGUF — она запустится почти на любом современном ноутбуке. Базовые модели без пометки instruct или chat не умеют вести диалог: они продолжают текст, а не отвечают на вопрос.
Проверьте лицензию и язык: не все открытые модели хорошо говорят по-русски. В карточке модели обычно перечислены поддерживаемые языки, а в обсуждениях на странице видно, с какими проблемами сталкивались другие пользователи.
LM Studio — если не хочется терминала
Тем, кто не любит командную строку, подойдёт графическая программа LM Studio: в ней есть поиск моделей Hugging Face, кнопка загрузки и окно чата. Программа сама подсказывает, какое квантование поместится в вашу память. Работает она с моделями в формате GGUF, а на Mac — ещё и с MLX.
Когда быстрее через ИИ-агента
Если вам нужен результат, а не своя локальная установка, ИИ-агент LeanTech запустит подходящую модель сам — для текста, кода, картинок или расшифровки — и отдаст готовый файл. Без видеокарты, очередей Spaces и Python, оплата картой РФ.
Чего агент не делает: не запускает модели на вашем компьютере и не разворачивает их на вашем сервере. Может написать скрипт запуска, который вы выполните сами.