Запустил недавно пару моделей локально, и понял, что с памятью ситуация не такая уж и простая. Например, для нормальной работы небольших LLM типа LLaMA 7B мне хватает 16 гб оперативки с запасом, но уже 13B или 30B модели — совсем другая история. Они требуют либо 24 ГБ, либо VRAM с 24+ гигабайтами, иначе всё тормозит и подгружается по частям, что убивает весь кайф.
Плюс, не все модели одинаково оптимизированы — у одних есть сжатые варианты с квантованием, которые можно запустить на 12-16 гб, а другим реально надо около 32 гб и быстрые NVMe для подкачки. Ещё влияет, как настроен софт — например, оптимизации в ONNX или BitsAndBytes реально помогают спасти память.
В общем, если хочешь запускать что-то более-менее серьезное с приличным размером, надо смотреть не только на количество ОЗУ, но и на VRAM видеокарты, а также не забывать про свопы. Кто что юзает лично? Есть у кого опыт запускать 13B+ на домашних железках без серверов?