День 9. Локальные модели: ИИ на своём компьютере
⏱ Время: 90 минут 🎯 Цель: Запустить нейросеть без интернета, без подписок и без цензуры 🛠 Нужно: Ollama · Open WebUI · Claude (для помощи в установке) · Docker Desktop
Зачем это тебе
Катя работает менеджером маркетплейса в небольшой компании, которая продаёт медицинские товары — ортопедические подушки, корсеты, товары для реабилитации. Ассортимент специфический, и Катя каждую неделю пишет описания карточек товаров, отвечает на отзывы, готовит тексты для акций.
Однажды она начала вставлять в ChatGPT реальные данные: «вот наш прайс с закупочными ценами, вот таблица остатков на складе, вот жалоба клиента с его именем и номером заказа — напиши ответ». И потом коллега спросил: «Ты понимаешь, что эти данные ты только что отправила на американские серверы?» Катя не думала об этом. Закупочные цены — коммерческая тайна. Данные клиентов — персональная информация. Всё это ушло в облако компании, которую она не знает и которой не доверяла.
Потом начались другие ситуации: на важной выставке не было интернета, и Катя не могла воспользоваться ИИ для быстрой подготовки коммерческого предложения. Ещё через месяц у ChatGPT случился сбой в самый неподходящий момент — дедлайн, а сервис лежит. Катя поняла: зависеть от чужого облака рискованно.
После сегодняшнего урока у Кати на ноутбуке будет работать своя нейросеть. Без интернета. Без передачи данных куда-либо. Без подписки. Можно вставлять любые внутренние документы, реальные цены, имена клиентов — всё остаётся на её компьютере. А ещё это бесплатно навсегда.
Теория
Что такое локальная модель — и почему это вообще возможно
Раньше запустить нейросеть у себя на компьютере было задачей для инженеров с дорогими серверами. Сейчас компании Meta, Google и Microsoft выпускают облегчённые версии своих моделей, которые работают на обычных ноутбуках. Это как разница между рестораном с профессиональной кухней (ChatGPT, Claude) и домашней плитой — блюда чуть проще, но готовишь сам, из своих продуктов, никто не видит, что ты готовишь.
Эти модели называются «открытыми» или open-source: их код и веса (то, чему нейросеть обучилась) опубликованы в открытом доступе. Любой может скачать и запустить.
Три причины запускать ИИ локально
Приватность данных. Когда ты пишешь в ChatGPT или Claude, твой запрос уходит на серверы в США. OpenAI прямо пишет в политике, что может использовать диалоги для улучшения модели (если не отключить в настройках). Для рабочих задач — прайсы, данные клиентов, внутренние отчёты — это проблема. Локальная модель видит данные только ты.
Работа без интернета. В командировке, на объекте, в самолёте, при плохом соединении — локальная модель работает всегда. Это особенно важно, если ты часто бываешь в местах с нестабильным интернетом.
Нет лимитов и цензуры. Облачные сервисы имеют ограничения: дневные лимиты запросов, фильтры контента, иногда — отказы отвечать на определённые темы. Локальная модель отвечает без ограничений. Особенно важно для специфических ниш — медицина, юриспруденция, алкоголь, оружие — где облачные фильтры иногда срабатывают некстати.
Что такое Ollama
Ollama — это программа, которая делает запуск локальных моделей простым. Без неё тебе пришлось бы разбираться с Python, библиотеками, конфигурационными файлами. С Ollama всё сводится к одной команде в терминале: ollama run llama3 — и через несколько минут у тебя работает нейросеть.
Думай об Ollama как о магазине приложений для нейросетей: заходишь, выбираешь модель по названию, скачиваешь, запускаешь. Всё.
Какие модели доступны бесплатно
Выбор модели зависит от мощности твоего компьютера. Вот что важно знать:
Llama 3 (Meta) — самая универсальная из открытых моделей. Хорошо понимает русский язык, справляется с разнообразными задачами: тексты, анализ, ответы на вопросы. Есть версии разного размера: 8B (8 миллиардов параметров) — для большинства ноутбуков, 70B — нужна мощная видеокарта.
Gemma 2 (Google) — быстрая и лёгкая. Версия 2B работает даже на слабых машинах. Хорошо подходит для простых задач: написать письмо, исправить текст, ответить на вопрос.
Phi-3 (Microsoft) — очень маленькая, специально создана для работы на обычных устройствах. Если у тебя старый ноутбук с 8 ГБ RAM — начни с неё. При своём размере удивительно умная.
Mistral — французская разработка, особенно хороша для текстовых задач: рерайт, копирайтинг, структурирование информации. Многие называют её лучшей в своём классе для работы с текстом.
Сколько нужно памяти (RAM)
Это главный технический вопрос. Нейросеть работает в оперативной памяти компьютера — как и все открытые вкладки браузера, только занимает больше места.
- 8 ГБ RAM — минимум. Запускай модели размером 2B–3B (gemma2:2b, phi3:mini). Работает медленнее, но работает.
- 16 ГБ RAM — комфортно. Можно запускать 7B–8B модели (llama3:8b, mistral:7b). Нормальная скорость ответа.
- 32 ГБ RAM — хорошо. Можно экспериментировать с моделями побольше.
- Видеокарта (GPU) — если есть, ускоряет работу в 5–10 раз. Но и без неё всё работает.
Проверь свою RAM: Windows — нажми Win+Pause → «Установленная память». Mac — Меню Apple → «Об этом Mac».
Разница между локальными моделями и Claude/ChatGPT
Честно: локальные модели слабее топовых облачных. Claude Sonnet или GPT-4 обучены на бо́льшем количестве данных, лучше рассуждают, точнее пишут. Но для многих рабочих задач разница несущественна. А для задач с конфиденциальными данными — локальная модель единственный правильный выбор.
Что такое Open WebUI
Когда ты запускаешь Ollama через терминал, интерфейс — это просто текст: пишешь вопрос, получаешь ответ. Никаких кнопок, никакой истории разговоров, неудобно. Open WebUI — это красивый веб-интерфейс поверх Ollama. Открываешь браузер, заходишь на localhost:3000 — и видишь интерфейс как у ChatGPT, только на своём компьютере. История диалогов сохраняется, можно переключаться между моделями, загружать файлы.
Демо: смотрим как работает
Шаг 1. Устанавливаем Ollama
Открываем браузер и идём на ollama.com. Видим большую кнопку Download. Нажимаем.
- Windows: скачивается файл
OllamaSetup.exe. Запускаем, нажимаем Install. Всё. В трее появляется иконка ламы. - Mac: скачивается
Ollama.dmg. Открываем, перетаскиваем в Applications. Запускаем. В меню-баре появляется иконка ламы.
Установка занимает 2–3 минуты. После этого Ollama работает фоном.
Шаг 2. Открываем терминал
- Windows: нажать Win+R, написать
cmd, Enter. Или найти «Командная строка» в поиске. - Mac: Spotlight (Cmd+Space), написать «Terminal», Enter.
Не пугайся чёрного окна с мигающим курсором — это просто способ давать команды компьютеру текстом.
Шаг 3. Скачиваем и запускаем первую модель
В терминале пишем:
ollama run gemma2:2b
И нажимаем Enter. Ollama начинает скачивать модель — это займёт 3–10 минут в зависимости от интернета (файл около 1.6 ГБ). Прогресс виден прямо в терминале.
Когда скачается, появится приглашение >>>. Это означает: модель запущена, можно писать. Пишем первый вопрос:
Напиши описание карточки товара для ортопедической подушки на Wildberries. Покупатель — человек с болью в шее. 150 слов.
Нажимаем Enter. Модель начинает отвечать — буква за буквой, как живой собеседник. Ответ появится через 10–40 секунд (зависит от мощности компьютера).
Сравниваем ответ с тем, что даёт Claude на тот же запрос. Замечаем разницу: Claude, скорее всего, ответит чуть более структурировано и продающе. Gemma2:2b — проще, но вполне рабочий текст.
Чтобы выйти из диалога — пишем /bye и Enter.
Шаг 4. Пробуем вопрос с конфиденциальными данными
Теперь пробуем то, что нельзя делать в облачных сервисах. Пишем:
Вот наши закупочные цены: подушка — 850 руб., корсет — 1200 руб., наколенник — 640 руб.
Наша наценка 120%. Рассчитай розничные цены и напиши, как позиционировать каждый товар
по цене относительно конкурентов.
Модель обрабатывает реальные данные. Они никуда не ушли — всё внутри твоего компьютера.
Шаг 5. Устанавливаем Docker Desktop и Open WebUI
Docker — программа, которая запускает приложения в изолированных контейнерах. Open WebUI работает через Docker. Идём на docker.com/products/docker-desktop, скачиваем и устанавливаем под свою ОС.
После установки Docker запускаем терминал и пишем одну команду:
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main
Выглядит страшно — но это просто одна длинная строка, её не надо понимать, просто скопировать. Docker скачает Open WebUI и запустит его.
Открываем браузер, пишем в адресной строке http://localhost:3000. Видим красивый интерфейс. Регистрируемся (данные хранятся локально), выбираем модель — и работаем как в ChatGPT, только на своём компьютере.
Практика
Задание 1. Установить Ollama
Зайди на ollama.com, скачай и установи Ollama под свою ОС. Убедись, что в трее (Windows) или меню-баре (Mac) появилась иконка ламы. Это значит — Ollama работает.
Задание 2. Запустить gemma2:2b
Открой терминал и выполни:
ollama run gemma2:2b
Дождись окончания загрузки. Когда появится >>> — ты внутри диалога с локальной нейросетью. Напиши любой вопрос и получи ответ.
Задание 3. Повтори промпт из Дня 2
Вернись к промпту, который ты использовал(а) на Дне 2. Задай его локальной модели. Затем задай тот же промпт Claude. Запиши ответы рядом и сравни по трём параметрам:
- Структура ответа
- Качество текста
- Скорость ответа
Задание 4. Задание с конфиденциальными данными
Придумай запрос, в котором используешь реальные внутренние данные своей работы — цены, показатели, имена клиентов (или условные, похожие на реальные). Задай его локальной модели. Убедись, что ответ полезен. Почувствуй разницу: эти данные не покинули твой компьютер.
Задание 5. Найди 5 отличий между Claude и локальной моделью
После работы с обеими системами составь список из пяти конкретных отличий. Не абстрактных («Claude умнее»), а наблюдаемых: «Claude структурирует ответ в пунктах, gemma2:2b пишет сплошным текстом», «Ollama отвечает медленнее примерно в 3 раза», «Claude не ответил на вопрос про конкурентов, локальная модель ответила» — что реально заметил(а).
Самостоятельная работа
Задача: Подобрать правильный инструмент для правильной задачи.
Возьми реальную задачу из своей работы на маркетплейсе — написание описания карточки, ответ на негативный отзыв, анализ конкурентов, составление письма поставщику.
- Реши эту задачу с помощью локальной модели (gemma2:2b или другой, которую установил(а)).
- Реши ту же задачу с помощью Claude.
- Запиши результат в любой формат (заметка, документ, таблица):
- Какую задачу решал(а)
- Чем ответ локальной модели хуже (что конкретно не так)
- Чем ответ локальной модели лучше или одинаково хорош
- Вывод: когда буду использовать локальную, а когда Claude
Ожидаемый итог: у тебя должен быть личный список «правил выбора» — конкретные типы задач для локальной модели (конфиденциальные данные, черновики, работа без интернета) и для Claude (финальные тексты, сложный анализ, нестандартные запросы).
Чек-лист урока
- [ ] Ollama установлена, иконка ламы появилась в системе
- [ ] Модель gemma2:2b скачана и запущена через терминал — первый ответ получен
- [ ] Один и тот же промпт задан локальной модели и Claude — разница зафиксирована
- [ ] Конфиденциальные данные переданы локальной модели — убедился(ась), что это безопасно
- [ ] Список из 5 отличий между Claude и локальной моделью написан
- [ ] Домашнее задание выполнено: реальная рабочая задача решена обоими инструментами, вывод записан