Локальная нейросеть: зачем запускать модель у себя и что для этого нужно


Локальная модель — это нейросеть, которая работает на вашем компьютере и не отправляет никуда ни одного запроса. Интерес к ним вырос по понятной причине: часть данных просто нельзя отдавать наружу.
Разберём, что для этого нужно, чем такие модели отличаются от облачных и в каких случаях овчинка стоит выделки.
Зачем это нужно
Данные не покидают компьютер. Договоры, медицинские записи, внутренняя переписка, исходный код — всё, что нельзя загружать в чужой сервис.
Нет зависимости от доступности сервиса, тарифов и блокировок. Модель скачана и работает всегда.
Нет ограничений по количеству запросов. Обработать десять тысяч документов локально — вопрос времени, а не бюджета.
Возможность дообучить модель под свою задачу и терминологию.
Что для этого нужно из железа
Главное — объём видеопамяти. Модель целиком помещается в память видеокарты, и от этого зависит, какого размера модель вы вообще сможете запустить.
Ориентир: 8 гигабайт видеопамяти — небольшие модели, 12-16 — средние, 24 и выше — крупные. Точные требования зависят от квантования.
Без видеокарты запуск возможен на процессоре и оперативной памяти, но скорость падает в разы: ответ печатается со скоростью медленной машинистки.
На Mac с чипами Apple память общая, и это заметное преимущество: 32 гигабайта памяти позволяют запускать модели, которые на обычном ПК потребовали бы дорогой видеокарты.
Что такое квантование
Способ сжать модель, огрубив точность чисел внутри неё. Модель занимает меньше памяти и работает быстрее ценой небольшой потери качества.
Обозначается как Q4, Q5, Q8 и подобное: чем меньше число, тем сильнее сжатие. Ходовой компромисс — Q4 и Q5, разница с полной версией на бытовых задачах невелика.
Именно квантование сделало локальный запуск реальным: модель, требовавшая 40 гигабайт, помещается в 12.
Про контекст
Контекст — сколько текста модель держит в голове за один раз. Он ест память отдельно от самой модели.
Большой контекст нужен для работы с документами: чтобы модель видела договор целиком, а не первые страницы.
Если памяти впритык, придётся выбирать между размером модели и длиной контекста. Часто выгоднее модель поменьше с большим контекстом.
Чем локальная модель отличается от облачной
Она слабее. Крупнейшие облачные модели работают на оборудовании, которое домой не поставить, и разница в сложных задачах заметна.
Она не знает свежих событий и не ходит в интернет, если вы сами не подключите поиск.
Она не подглядывает в ваши прошлые чаты и не запоминает ничего между сессиями без отдельной настройки.
Зато она стабильна: модель не обновится ночью и не начнёт отвечать иначе, чем вчера.
Для чего локальная модель годится уже сейчас
Разбор и суммаризация документов, включая конфиденциальные.
Классификация и извлечение данных: разложить тысячу обращений по темам, вытащить реквизиты из счетов.
Черновики текстов и переписки.
Помощь с кодом на распространённых языках.
Локальный поиск по своей базе документов — то, что называют RAG: модель отвечает, опираясь на ваши файлы.
Для чего пока не годится
Задачи, где нужна максимальная точность рассуждения: сложный анализ, многошаговые выводы, тонкая работа со смыслом.
Работа со свежей информацией без подключённого поиска.
Генерация изображений высокого качества — там свои модели и свои требования к железу.
С чего начать
Поставьте программу, которая скачивает и запускает модели за вас, — таких несколько, и все они дают графический интерфейс без командной строки.
Начните с небольшой модели на 7-8 миллиардов параметров в квантовании Q4. Она запустится почти на любом современном компьютере.
Проверьте на своей реальной задаче, а не на вопросах о смысле жизни. Понятно станет за полчаса.
Если качества не хватает, поднимайтесь по размеру, пока хватает памяти. Разница между 8 и 14 миллиардами обычно заметнее, чем между квантованиями.
Кому это точно нужно
Тем, кто работает с персональными данными и коммерческой тайной.
Тем, у кого объёмы такие, что облачные тарифы становятся заметной статьёй расходов.
Тем, кому нужна предсказуемость: одна и та же модель, один и тот же ответ, без обновлений в неудачный момент.
Остальным облачная модель проще, дешевле и умнее — и в этом нет ничего плохого.


