Локальная нейросеть без облака. Как запустить ИИ на своем компьютере

1941
Локальная нейросеть без облака. Как запустить ИИ на своем компьютере

Представим обычную рабочую задачу. Нужно быстро найти спорный пункт в договоре, пересказать медицинское заключение, разобраться в нескольких тысячах строк кода или задать вопросы по внутренней документации компании. Облачный ИИ справится за минуту, но вместе с запросом наружу может уйти исходный документ. Мне такой обмен нравится далеко не всегда.

Альтернатива уже вполне бытовая. Современную языковую модель можно скачать на обычный компьютер и запускать локально через Ollama или LM Studio. После первоначальной загрузки весов интернет модели вообще не нужен. Запросы обрабатывает ваш процессор или видеокарта, документы остаются на машине. Но есть принципиальная оговорка. Надпись «локальная модель» еще не означает, что вся программа работает без сети. Обновления, поиск моделей, веб-поиск, облачные модели, плагины и внешние инструменты могут обращаться в интернет отдельно.

Поэтому я проверяю локальный ИИ в два этапа. Сначала выясняю, где именно выполняется модель. Затем проверяю весь путь документа от диска до ответа. Только второй подход дает нормальное основание говорить о конфиденциальности.

Материал предназначен для легальной работы со своими данными и системами, к которым у пользователя есть разрешенный доступ. При обработке персональных данных, коммерческой тайны и внутренней корпоративной информации нужно соблюдать законодательство своей страны, особенно российские требования к защите персональных данных и конфиденциальной информации. Локальная нейросеть сама по себе не делает обработку данных автоматически законной и безопасной.

Какое железо действительно нужно для 7B, 14B и 30B

Первое число, которое встречается рядом с названием модели, обычно выглядит как 7B, 8B, 14B, 30B, 32B или 70B. Буква B означает миллиарды параметров. Параметры можно грубо представить как огромное количество чисел, из которых состоит обученная модель.

Если хранить каждое значение с высокой точностью, домашнему компьютеру быстро станет тяжело. Поэтому локальные модели обычно распространяют в квантизированном виде. Квантизация уменьшает точность хранения весов и резко сокращает размер модели. Популярный формат Q4_K_M относится к примерно четырехбитному классу квантизации и часто дает разумный баланс между размером и качеством.

На практике файл модели занимает больше, чем простая формула «число параметров умножить на четыре бита». Часть тензоров хранится с другой точностью, присутствуют метаданные и служебные структуры. Для ориентира Q4-модель класса 8B обычно занимает около 5 ГБ, 14B около 9 ГБ, 30B-32B около 19-21 ГБ, а 70B примерно 40-45 ГБ.

Класс модели Примерный размер Q4 Разумный объем RAM Видеопамять для преимущественно GPU-запуска Типичный сценарий
7B-8B 4-6 ГБ 16 ГБ 6-8 ГБ Тексты, краткие документы, перевод, простые задачи с кодом
12B-14B 8-10 ГБ 24-32 ГБ 12-16 ГБ Более сложные инструкции, документы, программирование
27B-32B 18-22 ГБ 32-64 ГБ 24 ГБ Серьезная локальная рабочая модель для мощного ПК
70B 40-45 ГБ 64-96 ГБ 48 ГБ и больше Рабочая станция или несколько видеокарт

Я специально называю цифры ориентирами, а не системными требованиями. Память расходуют не только веса. Модели нужен кэш внимания, память под контекст, временные буферы, сама программа и операционная система. Если увеличить контекст с нескольких тысяч до десятков тысяч токенов, расход памяти может заметно вырасти.

Есть еще одна ловушка. Число параметров не всегда описывает вычислительную нагрузку. У моделей типа Mixture of Experts, то есть смеси экспертов, на диске могут лежать десятки миллиардов параметров, но при обработке конкретного токена активируется только часть. Такая модель иногда считает быстрее плотной модели сопоставимого общего размера, однако веса все равно нужно где-то хранить. Поэтому надпись «30B, активно 3B» не превращает 30-миллиардную модель в файл размером как у 3B.

Без видеокарты нейросеть тоже работает. llama.cpp и построенные вокруг него программы умеют выполнять вычисления на процессоре. Небольшая 7B-8B модель на современном настольном CPU вполне пригодна для нерегулярной работы. С ростом размера ответы становятся медленнее. Запустить 30B через CPU и оперативную память технически можно, но слово «запустить» здесь не равно слову «удобно пользоваться».

Видеокарта дает гораздо более заметный прирост. Самый простой путь на обычном Windows-ПК по-прежнему часто дает NVIDIA, но Ollama поддерживает и ряд AMD Radeon через ROCm, Apple GPU через Metal, а для дополнительных видеокарт существует экспериментальный путь через Vulkan. Поддержка конкретного ускорителя меняется, поэтому перед покупкой железа я бы проверил не форум трехлетней давности, а текущую документацию.

На компьютерах Apple Silicon работает другая модель памяти. CPU и GPU используют общую память. Mac с 32 или 64 ГБ поэтому способен разместить на GPU значительно более крупную модель, чем ноутбук с 32 ГБ обычной RAM и дискретной видеокартой на 8 ГБ. Всю заявленную память модель при этом не получает, часть нужна macOS и приложениям.

Ollama или LM Studio. Что поставить обычному пользователю

Если нужен локальный аналог ChatGPT с обычным окном, я бы начал с LM Studio. Если нужен движок для программ, сценариев и собственного интерфейса, удобнее Ollama.

Ollama работает как локальный сервер моделей. После установки на Windows программа поднимает API на 127.0.0.1:11434. Адрес 127.0.0.1 указывает на ваш же компьютер. Пока сервер привязан к loopback-интерфейсу, другие компьютеры сети напрямую к нему не подключаются.

ollama pull qwen3:8b
 ollama run qwen3:8b
 
 ollama list
 ollama ps

На Windows загруженные Ollama модели по умолчанию лежат в каталоге C:Usersимя_пользователя.ollamamodels. Если системный SSD небольшой, путь можно поменять через переменную OLLAMA_MODELS.

Ollama сам по себе прежде всего запускает модель и предоставляет API. Удобного встроенного сценария «бросить сто PDF и разговаривать с архивом» от простого движка ждать не стоит. Для базы документов обычно подключают отдельную оболочку, систему RAG или пишут небольшой сервис. И как раз здесь можно случайно потерять конфиденциальность. Локальная Ollama ничего не отправляет, а подключенная сверху оболочка использует внешний сервис распознавания, облачную модель эмбеддингов или веб-инструмент.

LM Studio больше похож на готовое настольное приложение. Для Windows разработчики рекомендуют как минимум 16 ГБ RAM, а для x64-процессоров требуется AVX2. Отдельная видеокарта не обязательна, хотя для комфортной работы она сильно помогает.

LM Studio хранит каталог моделей внутри ~/.lmstudio/models, если пользователь не выбрал другую папку в My Models. На Windows история разговоров находится в %USERPROFILE%.lmstudioconversations. Конкретный чат можно открыть через Show in File Explorer. Такой мелкий пункт мне нравится больше обещания «все приватно», потому что пользователь буквально видит локальные файлы.

Главное преимущество LM Studio для нашей задачи заключается в документах. В чат можно прикрепить .pdf, .docx и .txt. Если текст помещается в контекст модели, приложение передает его модели целиком. Для большого документа включается поиск по релевантным фрагментам, то есть RAG.

RAG не означает, что модель «изучила» ваш архив. Система извлекает текст, разбивает материал на части, находит фрагменты, похожие на вопрос, и добавляет найденный текст в контекст. Поэтому запрос «какой штраф указан при задержке поставки и в каком пункте договора» обычно полезнее, чем «расскажи главное про договор».

У RAG есть слабое место, о котором легко забыть. Если релевантный кусок документа не попал в выборку, языковая модель может отвечать по неполному контексту. Таблицы, сложная верстка и плохо распознанные сканы увеличивают риск. Из PDF, состоящего из фотографий страниц, сначала придется получить нормальный текстовый слой. Если распознавание выполняет сторонний облачный сервис, документ уже перестал быть полностью локальным.

Почему «локальный ИИ» все равно может отправить данные наружу

И Ollama, и LM Studio заметно выросли из первоначальной концепции офлайн-запуска. Обе системы теперь умеют больше, чем просто крутить файл модели на вашем компьютере.

Согласно документации LM Studio, уже скачанные локальные модели, обычный чат, работа с документами и локальный сервер могут функционировать без интернета. Но поиск и загрузка моделей, скачивание исполнительных модулей и проверка обновлений требуют сети. В программе также существуют облачные модели, веб-поиск и другие сетевые возможности. Если выбрать облачный режим, запрос физически покинет компьютер независимо от политики хранения у провайдера.

С Ollama действует та же логика. При локальном запуске разработчики заявляют, что содержимое запросов и ответов не передается на ollama.com. Но в Ollama есть облачные модели и веб-поиск. В официальном FAQ Ollama описан отдельный локальный режим, который отключает облачные функции.

setx OLLAMA_NO_CLOUD 1

После изменения переменной Ollama нужно перезапустить. Настройка блокирует облачный вывод и веб-поиск. Я бы включал такой режим на компьютере с конфиденциальными документами даже тогда, когда облачными функциями никто не собирается пользоваться. Защита от случайного выбора неправильной модели полезнее надежды на внимательность пользователя.

Другая потенциальная дыра находится в MCP и инструментах агента. Локальная модель может вызвать подключенный сервер, а сервер уже отправит текст поисковику, системе управления задачами, внешнему API или другой модели. Для собственного RAG действует похожее правило. Если эмбеддинги рассчитывает облачный сервис, наружу уходит текст, из которого строятся векторы. Поэтому фраза «сама LLM работает локально» описывает лишь один участок системы.

Еще опаснее случайно открыть локальный API в сеть. Ollama по умолчанию слушает 127.0.0.1:11434, LM Studio тоже может работать только через localhost. Но обе программы позволяют изменить привязку сервера и принимать запросы из локальной сети. Например, адрес 0.0.0.0 означает прослушивание всех подходящих сетевых интерфейсов. Если такой сервер нужен только одному компьютеру, я бы не открывал его наружу вообще.

Наконец, локальность приложения ничего не говорит о Windows вокруг него. OneDrive может синхронизировать пользовательские папки. Корпоративный агент DLP способен анализировать файлы. Защитное ПО может отправлять подозрительные образцы в облако. Средство резервного копирования может копировать каталог разговоров. Ни Ollama, ни LM Studio не могут обещать, что другие программы на компьютере не трогают ваши данные.

Как я бы проверял действительно офлайн-систему

Самая простая проверка не требует специальных знаний. Скачиваем программу, нужный исполнительный модуль и модель, полностью отключаем Wi-Fi и Ethernet, запускаем приложение и задаем несколько вопросов. Если локальный чат продолжает отвечать, вывод модели явно не зависит от облака.

Следующий шаг нужен для документов. Отключаем сеть, создаем новый чат, прикрепляем PDF и задаем вопрос, ответ на который находится только внутри файла. Если система находит нужный пункт, обработка документа тоже способна работать офлайн.

На Windows после возвращения сети можно посмотреть активные соединения стандартными средствами PowerShell.

Get-NetTCPConnection |
   Where-Object State -eq "Established" |
   Select-Object LocalAddress, LocalPort, RemoteAddress, RemotePort, OwningProcess

Идентификатор процесса затем связываем с программой.

Get-Process -Id 1234

Удобнее наблюдать трафик через TCPView из набора Sysinternals. Программа показывает TCP- и UDP-соединения вместе с процессами. Я запускаю локальный ИИ, открываю документ, отправляю несколько запросов и смотрю, появляется ли внешний адрес именно в момент обработки.

Если нужен жесткий режим, Windows Firewall умеет запретить конкретной программе исходящие соединения. Для стандартной установки Ollama путь обычно выглядит так.

$ollama = "$env:LOCALAPPDATAProgramsOllamaollama.exe"
 
 New-NetFirewallRule `
   -DisplayName "Ollama outbound block" `
   -Direction Outbound `
   -Program $ollama `
   -Action Block

Удаляется правило одной командой.

Remove-NetFirewallRule -DisplayName "Ollama outbound block"

Такой фильтр не стоит воспринимать как магический рубильник. Приложение может использовать вспомогательные процессы, а обновленная версия способна изменить структуру каталогов. Перед созданием правил я проверяю реальные пути процессов, а после блокировки повторяю тест сетевых соединений.

Для особо чувствительной информации программной настройки мне уже мало. Самый понятный вариант выглядит старомодно. Отдельный компьютер или виртуальная среда, зашифрованный диск, заранее загруженные модели, никаких облачных папок, сетевой интерфейс отключен. Физически отсутствующий канал передачи проверить проще, чем десяток галочек в разных программах.

За такую изоляцию приходится платить функциональностью. Офлайн-модель не знает свежих событий после своего обучения, сама не проверит актуальную редакцию документа в интернете и не сможет пользоваться веб-поиском. Нужные материалы приходится приносить локально. Для договоров, архивов, исходного кода и внутренней базы знаний такой обмен часто вполне разумен.

Есть еще одна граница, про которую регулярно забывают. «Можно скачать веса» и «модель полностью открытая» не одно и то же. Разные семейства распространяются по разным лицензиям. У компании могут появиться ограничения на коммерческое использование, распространение модифицированных весов или другие условия. Перед внедрением я проверял бы лицензию конкретной модели так же внимательно, как объем видеопамяти.

Мой практический старт выглядит просто. Для обычного ПК беру модель класса 7B-8B в Q4. Если 16 ГБ памяти хватает и скорость устраивает, проверяю качество на своих реальных задачах. Затем пробую 12B-14B. К 30B-32B перехожу только тогда, когда меньшая модель действительно ошибается там, где более крупная приносит измеримую пользу. Покупать 24 ГБ видеопамяти ради красивой цифры в названии модели смысла нет.

Для работы с отдельными документами без программирования я бы выбрал LM Studio. Для интеграций и собственного локального сервиса удобнее Ollama. В обоих случаях конфиденциальность дает не название программы, а проверяемая цепочка. Модель хранится локально, вывод идет на вашем железе, документы обрабатываются локально, облачные функции отключены, сервер не торчит в сети, внешние инструменты проверены, сетевой трафик контролируется. Только после такой проверки выражение «нейросеть без облака» начинает что-то значить.

Частые вопросы о локальных нейросетях

Можно ли запустить нейросеть без видеокарты

Да. Квантизированные модели можно выполнять на процессоре и хранить в оперативной памяти. Для 7B-8B такой вариант вполне рабочий. С увеличением размера главным ограничением обычно становится скорость.

Сколько оперативной памяти нужно для локального ИИ

Для моделей 7B-8B я бы ориентировался на 16 ГБ RAM, для 12B-14B на 24-32 ГБ, для 30B-32B на 32-64 ГБ. Конкретный расход зависит от квантизации, архитектуры и длины контекста.

Можно ли использовать Ollama полностью без интернета

Да. После загрузки локальной модели Ollama умеет выполнять вывод без интернета. Облачные функции можно дополнительно отключить через OLLAMA_NO_CLOUD=1.

Отправляет ли LM Studio документы в облако

При использовании локальной модели встроенная работа с документами выполняется на компьютере и может работать без подключения к интернету. Облачные модели, веб-поиск и другие сетевые функции нужно рассматривать отдельно.

Что лучше Ollama или LM Studio

LM Studio проще для обычного чата и ручной работы с файлами. Ollama удобнее как локальный движок и API для программ, сценариев и интеграций. Оба инструмента позволяют выполнять модели локально.

Безопасно ли загружать конфиденциальные документы в локальную нейросеть

Только после проверки всей системы. Локальный вывод модели снижает риск передачи документа поставщику облачного ИИ, но данные по-прежнему могут попасть наружу через облачный поиск, MCP, сторонние плагины, удаленные эмбеддинги, резервное копирование или другие программы на компьютере.

Может ли локальная нейросеть работать с PDF и Word

Да. LM Studio напрямую поддерживает PDF, DOCX и TXT. Для Ollama обычно используют отдельную RAG-систему или приложение поверх локального API. Сканированные документы без текстового слоя могут потребовать предварительного локального распознавания текста.

Alt text
Обращаем внимание, что все материалы в этом блоге представляют личное мнение их авторов. Редакция SecurityLab.ru не несет ответственности за точность, полноту и достоверность опубликованных данных. Вся информация предоставлена «как есть» и может не соответствовать официальной позиции компании.
SECURITM
ФСТЭК · Обновление 2026
03
сен

ФСТЭК и Правительство обновили требования.
Что изменилось этим летом и что важно учесть?

Разберём 3 сентября в 11:00.

Регистрация
Реклама. 18+ ООО «Секъюритм» ИНН 7820074059

Юрий Кочетов

Здесь я делюсь своими не самыми полезными, но крайне забавными мыслями о том, как устроен этот мир. Если вы устали от скучных советов и правильных решений, то вам точно сюда.