Курс Неделя 2 День 9
← День 8 День 10 →

День 9. Локальные модели: ИИ на своём компьютере

Время: 90 минут 🎯 Цель: Запустить нейросеть без интернета, без подписок и без цензуры 🛠 Нужно: Ollama · Open WebUI · Claude (для помощи в установке) · Docker Desktop


Зачем это тебе

Катя работает менеджером маркетплейса в небольшой компании, которая продаёт медицинские товары — ортопедические подушки, корсеты, товары для реабилитации. Ассортимент специфический, и Катя каждую неделю пишет описания карточек товаров, отвечает на отзывы, готовит тексты для акций.

Однажды она начала вставлять в ChatGPT реальные данные: «вот наш прайс с закупочными ценами, вот таблица остатков на складе, вот жалоба клиента с его именем и номером заказа — напиши ответ». И потом коллега спросил: «Ты понимаешь, что эти данные ты только что отправила на американские серверы?» Катя не думала об этом. Закупочные цены — коммерческая тайна. Данные клиентов — персональная информация. Всё это ушло в облако компании, которую она не знает и которой не доверяла.

Потом начались другие ситуации: на важной выставке не было интернета, и Катя не могла воспользоваться ИИ для быстрой подготовки коммерческого предложения. Ещё через месяц у ChatGPT случился сбой в самый неподходящий момент — дедлайн, а сервис лежит. Катя поняла: зависеть от чужого облака рискованно.

После сегодняшнего урока у Кати на ноутбуке будет работать своя нейросеть. Без интернета. Без передачи данных куда-либо. Без подписки. Можно вставлять любые внутренние документы, реальные цены, имена клиентов — всё остаётся на её компьютере. А ещё это бесплатно навсегда.


Теория

Что такое локальная модель — и почему это вообще возможно

Раньше запустить нейросеть у себя на компьютере было задачей для инженеров с дорогими серверами. Сейчас компании Meta, Google и Microsoft выпускают облегчённые версии своих моделей, которые работают на обычных ноутбуках. Это как разница между рестораном с профессиональной кухней (ChatGPT, Claude) и домашней плитой — блюда чуть проще, но готовишь сам, из своих продуктов, никто не видит, что ты готовишь.

Эти модели называются «открытыми» или open-source: их код и веса (то, чему нейросеть обучилась) опубликованы в открытом доступе. Любой может скачать и запустить.

Три причины запускать ИИ локально

Приватность данных. Когда ты пишешь в ChatGPT или Claude, твой запрос уходит на серверы в США. OpenAI прямо пишет в политике, что может использовать диалоги для улучшения модели (если не отключить в настройках). Для рабочих задач — прайсы, данные клиентов, внутренние отчёты — это проблема. Локальная модель видит данные только ты.

Работа без интернета. В командировке, на объекте, в самолёте, при плохом соединении — локальная модель работает всегда. Это особенно важно, если ты часто бываешь в местах с нестабильным интернетом.

Нет лимитов и цензуры. Облачные сервисы имеют ограничения: дневные лимиты запросов, фильтры контента, иногда — отказы отвечать на определённые темы. Локальная модель отвечает без ограничений. Особенно важно для специфических ниш — медицина, юриспруденция, алкоголь, оружие — где облачные фильтры иногда срабатывают некстати.

Что такое Ollama

Ollama — это программа, которая делает запуск локальных моделей простым. Без неё тебе пришлось бы разбираться с Python, библиотеками, конфигурационными файлами. С Ollama всё сводится к одной команде в терминале: ollama run llama3 — и через несколько минут у тебя работает нейросеть.

Думай об Ollama как о магазине приложений для нейросетей: заходишь, выбираешь модель по названию, скачиваешь, запускаешь. Всё.

Какие модели доступны бесплатно

Выбор модели зависит от мощности твоего компьютера. Вот что важно знать:

Llama 3 (Meta) — самая универсальная из открытых моделей. Хорошо понимает русский язык, справляется с разнообразными задачами: тексты, анализ, ответы на вопросы. Есть версии разного размера: 8B (8 миллиардов параметров) — для большинства ноутбуков, 70B — нужна мощная видеокарта.

Gemma 2 (Google) — быстрая и лёгкая. Версия 2B работает даже на слабых машинах. Хорошо подходит для простых задач: написать письмо, исправить текст, ответить на вопрос.

Phi-3 (Microsoft) — очень маленькая, специально создана для работы на обычных устройствах. Если у тебя старый ноутбук с 8 ГБ RAM — начни с неё. При своём размере удивительно умная.

Mistral — французская разработка, особенно хороша для текстовых задач: рерайт, копирайтинг, структурирование информации. Многие называют её лучшей в своём классе для работы с текстом.

Сколько нужно памяти (RAM)

Это главный технический вопрос. Нейросеть работает в оперативной памяти компьютера — как и все открытые вкладки браузера, только занимает больше места.

  • 8 ГБ RAM — минимум. Запускай модели размером 2B–3B (gemma2:2b, phi3:mini). Работает медленнее, но работает.
  • 16 ГБ RAM — комфортно. Можно запускать 7B–8B модели (llama3:8b, mistral:7b). Нормальная скорость ответа.
  • 32 ГБ RAM — хорошо. Можно экспериментировать с моделями побольше.
  • Видеокарта (GPU) — если есть, ускоряет работу в 5–10 раз. Но и без неё всё работает.

Проверь свою RAM: Windows — нажми Win+Pause → «Установленная память». Mac — Меню Apple → «Об этом Mac».

Разница между локальными моделями и Claude/ChatGPT

Честно: локальные модели слабее топовых облачных. Claude Sonnet или GPT-4 обучены на бо́льшем количестве данных, лучше рассуждают, точнее пишут. Но для многих рабочих задач разница несущественна. А для задач с конфиденциальными данными — локальная модель единственный правильный выбор.

Что такое Open WebUI

Когда ты запускаешь Ollama через терминал, интерфейс — это просто текст: пишешь вопрос, получаешь ответ. Никаких кнопок, никакой истории разговоров, неудобно. Open WebUI — это красивый веб-интерфейс поверх Ollama. Открываешь браузер, заходишь на localhost:3000 — и видишь интерфейс как у ChatGPT, только на своём компьютере. История диалогов сохраняется, можно переключаться между моделями, загружать файлы.


Демо: смотрим как работает

Шаг 1. Устанавливаем Ollama

Открываем браузер и идём на ollama.com. Видим большую кнопку Download. Нажимаем.

  • Windows: скачивается файл OllamaSetup.exe. Запускаем, нажимаем Install. Всё. В трее появляется иконка ламы.
  • Mac: скачивается Ollama.dmg. Открываем, перетаскиваем в Applications. Запускаем. В меню-баре появляется иконка ламы.

Установка занимает 2–3 минуты. После этого Ollama работает фоном.

Шаг 2. Открываем терминал

  • Windows: нажать Win+R, написать cmd, Enter. Или найти «Командная строка» в поиске.
  • Mac: Spotlight (Cmd+Space), написать «Terminal», Enter.

Не пугайся чёрного окна с мигающим курсором — это просто способ давать команды компьютеру текстом.

Шаг 3. Скачиваем и запускаем первую модель

В терминале пишем:

ollama run gemma2:2b

И нажимаем Enter. Ollama начинает скачивать модель — это займёт 3–10 минут в зависимости от интернета (файл около 1.6 ГБ). Прогресс виден прямо в терминале.

Когда скачается, появится приглашение >>>. Это означает: модель запущена, можно писать. Пишем первый вопрос:

Напиши описание карточки товара для ортопедической подушки на Wildberries. Покупатель — человек с болью в шее. 150 слов.

Нажимаем Enter. Модель начинает отвечать — буква за буквой, как живой собеседник. Ответ появится через 10–40 секунд (зависит от мощности компьютера).

Сравниваем ответ с тем, что даёт Claude на тот же запрос. Замечаем разницу: Claude, скорее всего, ответит чуть более структурировано и продающе. Gemma2:2b — проще, но вполне рабочий текст.

Чтобы выйти из диалога — пишем /bye и Enter.

Шаг 4. Пробуем вопрос с конфиденциальными данными

Теперь пробуем то, что нельзя делать в облачных сервисах. Пишем:

Вот наши закупочные цены: подушка — 850 руб., корсет — 1200 руб., наколенник — 640 руб. 
Наша наценка 120%. Рассчитай розничные цены и напиши, как позиционировать каждый товар 
по цене относительно конкурентов.

Модель обрабатывает реальные данные. Они никуда не ушли — всё внутри твоего компьютера.

Шаг 5. Устанавливаем Docker Desktop и Open WebUI

Docker — программа, которая запускает приложения в изолированных контейнерах. Open WebUI работает через Docker. Идём на docker.com/products/docker-desktop, скачиваем и устанавливаем под свою ОС.

После установки Docker запускаем терминал и пишем одну команду:

docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main

Выглядит страшно — но это просто одна длинная строка, её не надо понимать, просто скопировать. Docker скачает Open WebUI и запустит его.

Открываем браузер, пишем в адресной строке http://localhost:3000. Видим красивый интерфейс. Регистрируемся (данные хранятся локально), выбираем модель — и работаем как в ChatGPT, только на своём компьютере.


Практика

Задание 1. Установить Ollama

Зайди на ollama.com, скачай и установи Ollama под свою ОС. Убедись, что в трее (Windows) или меню-баре (Mac) появилась иконка ламы. Это значит — Ollama работает.

Задание 2. Запустить gemma2:2b

Открой терминал и выполни:

ollama run gemma2:2b

Дождись окончания загрузки. Когда появится >>> — ты внутри диалога с локальной нейросетью. Напиши любой вопрос и получи ответ.

Задание 3. Повтори промпт из Дня 2

Вернись к промпту, который ты использовал(а) на Дне 2. Задай его локальной модели. Затем задай тот же промпт Claude. Запиши ответы рядом и сравни по трём параметрам:

  • Структура ответа
  • Качество текста
  • Скорость ответа

Задание 4. Задание с конфиденциальными данными

Придумай запрос, в котором используешь реальные внутренние данные своей работы — цены, показатели, имена клиентов (или условные, похожие на реальные). Задай его локальной модели. Убедись, что ответ полезен. Почувствуй разницу: эти данные не покинули твой компьютер.

Задание 5. Найди 5 отличий между Claude и локальной моделью

После работы с обеими системами составь список из пяти конкретных отличий. Не абстрактных («Claude умнее»), а наблюдаемых: «Claude структурирует ответ в пунктах, gemma2:2b пишет сплошным текстом», «Ollama отвечает медленнее примерно в 3 раза», «Claude не ответил на вопрос про конкурентов, локальная модель ответила» — что реально заметил(а).


Самостоятельная работа

Задача: Подобрать правильный инструмент для правильной задачи.

Возьми реальную задачу из своей работы на маркетплейсе — написание описания карточки, ответ на негативный отзыв, анализ конкурентов, составление письма поставщику.

  1. Реши эту задачу с помощью локальной модели (gemma2:2b или другой, которую установил(а)).
  2. Реши ту же задачу с помощью Claude.
  3. Запиши результат в любой формат (заметка, документ, таблица):
    • Какую задачу решал(а)
    • Чем ответ локальной модели хуже (что конкретно не так)
    • Чем ответ локальной модели лучше или одинаково хорош
    • Вывод: когда буду использовать локальную, а когда Claude

Ожидаемый итог: у тебя должен быть личный список «правил выбора» — конкретные типы задач для локальной модели (конфиденциальные данные, черновики, работа без интернета) и для Claude (финальные тексты, сложный анализ, нестандартные запросы).


Чек-лист урока

  • [ ] Ollama установлена, иконка ламы появилась в системе
  • [ ] Модель gemma2:2b скачана и запущена через терминал — первый ответ получен
  • [ ] Один и тот же промпт задан локальной модели и Claude — разница зафиксирована
  • [ ] Конфиденциальные данные переданы локальной модели — убедился(ась), что это безопасно
  • [ ] Список из 5 отличий между Claude и локальной моделью написан
  • [ ] Домашнее задание выполнено: реальная рабочая задача решена обоими инструментами, вывод записан