Если коротко, сколько VRAM нужно для Llama 70B, зависит не только от самой модели, но и от квантования, длины контекста и того, как именно вы собираетесь запустить LLM локально. В полной точности FP16 70B-модель требует слишком много памяти для обычной одной видеокарты, но при квантовании модели требования резко снижаются и становятся реальными для нескольких GPU, профессиональных ускорителей или мощной рабочей станции.