Chạy Stable Diffusion local: Bao nhiêu VRAM là đủ?

Chạy Stable Diffusion local: Bao nhiêu VRAM là đủ?

Chia sẻ:

Câu hỏi đầu tiên của người muốn chạy Stable Diffusion local luôn là máy cần bao nhiêu VRAM. Đáp án ngắn gọn: 4GB đủ cho SDXL bản nén sâu, 8GB chạy được các mô hình đời 2026, còn từ 12GB trở lên mới thật sự thoải mái. Nhưng con số đó chỉ đúng khi chọn đúng mô hình và đúng bản nén, và đây chính là chỗ phần lớn hướng dẫn tiếng Việt đang lạc hậu. Chúng vẫn dạy cài Automatic1111, giao diện đã ngừng phát hành từ tháng 2/2025 và không chạy nổi bất kỳ mô hình nào ra sau đó.

Bản đồ mô hình tạo ảnh 2026 đã đổi, Stable Diffusion không còn dẫn đầu

Điều ít bài viết về Stable Diffusion local nhắc tới là Stability AI đã gần như rời khỏi cuộc đua mô hình ảnh mã nguồn mở. Mô hình tạo ảnh mới nhất của hãng vẫn là Stable Diffusion 3.5 phát hành tháng 10/2024, còn toàn bộ sản phẩm năm 2025 và 2026 của họ chuyển sang mảng âm thanh và mô hình 3D. Không có phiên bản Stable Diffusion 4 nào tồn tại, dù một số trang tin tự động có đăng tin về nó.

Đáng chú ý hơn, chính SD 3.5 mới là bản thất bại. Thống kê lượt tải trong 30 ngày gần nhất cho thấy bản Medium đạt khoảng 101 nghìn và bản Large khoảng 60 nghìn, tức thua xa chính SDXL đời 2023 với 1,5 triệu lượt. Người chạy Stable Diffusion local đã bỏ qua thế hệ mới của Stability để chuyển sang hai dòng mô hình khác.

Mô hình Phát hành Số tham số Lượt tải 30 ngày
FLUX.2-dev 11/2025 32 tỉ 1,35 triệu
Z-Image-Turbo 11/2025 6 tỉ 1,16 triệu
Stable Diffusion 1.5 08/2022 0,9 tỉ 1,68 triệu
Stable Diffusion XL 07/2023 3,5 tỉ 1,50 triệu
FLUX.2-klein 4B 01/2026 4 tỉ 387 nghìn
Stable Diffusion 3.5 Medium 10/2024 2,5 tỉ 101 nghìn

Hai dòng thay thế là FLUX của Black Forest Labs và Z-Image của nhóm Tongyi thuộc Alibaba. FLUX.2-dev dẫn đầu về lượt tải, còn Z-Image-Turbo chỉ 6 tỉ tham số nhưng dùng giấy phép Apache 2.0 nên thoải mái cho mục đích thương mại, điều mà các bản dev của FLUX không cho phép.

Vậy vì sao SD 1.5 và SDXL vẫn đứng đầu bảng lượt tải? Vì hai mô hình này đã tích luỹ một kho LoRA và checkpoint cộng đồng khổng lồ suốt ba năm. Người chạy Stable Diffusion local hiện nay thường giữ chúng cho các phong cách đặc thù, còn công việc dựng ảnh chính thì chuyển sang mô hình mới. Đây là điểm mà các bài hướng dẫn cũ không phản ánh được.

Ngưỡng VRAM thực tế khi chạy Stable Diffusion local sau khi nén

Con số VRAM cho Stable Diffusion local thường được trích dẫn ở định dạng gốc BF16, và nó khiến nhiều người kết luận sai rằng máy đang có không chạy nổi. Thực tế mọi mô hình hiện hành đều có bản nén sẵn, và chính nhà phát hành cũng đưa ra bản FP8 ngay trong ngày ra mắt chứ không để cộng đồng tự làm như giai đoạn trước.

Black Forest Labs công bố con số cụ thể cho hai mức nén: định dạng FP8 chạy nhanh hơn 1,6 lần và giảm 40% dung lượng bộ nhớ, còn NVFP4 dành cho card RTX 50 series nhanh hơn 2,7 lần và giảm tới 55%. Đây là khác biệt đủ lớn để đổi hẳn nhóm phần cứng chạy được Stable Diffusion local.

Mô hình Bản gốc BF16 Bản FP8 Bản nén 4-bit
Stable Diffusion XL khoảng 8GB khoảng 5GB khoảng 4GB
FLUX.2-klein 4B khoảng 13GB khoảng 8GB khoảng 6GB
Z-Image-Turbo 6B 14 tới 16GB khoảng 8GB khoảng 6GB
FLUX.1-dev 12B khoảng 24GB khoảng 12GB khoảng 7GB
FLUX.2-dev 32B trên 64GB khoảng 32GB khoảng 19GB

Có một cơ chế nữa giải thích vì sao card 16GB vẫn nạp được mô hình nặng hơn 16GB. Giao diện ComfyUI nạp bộ mã hoá văn bản trước, mã hoá xong câu lệnh thì giải phóng nó khỏi bộ nhớ rồi mới nạp phần dựng ảnh. Đỉnh tiêu thụ vì thế bằng phần lớn hơn trong hai khối chứ không phải tổng của cả hai.

Điều này quan trọng với người chạy Stable Diffusion local vì các mô hình đời mới dùng bộ mã hoá văn bản rất nặng. FLUX.2 gọi sang một mô hình ngôn ngữ 24 tỉ tham số chỉ để hiểu câu lệnh, còn Krea 2 dùng bản 4 tỉ tham số. Nếu tính gộp cả hai khối thì gần như không laptop nào chạy nổi, nhưng trên thực tế cơ chế nạp luân phiên đã giải quyết phần lớn vấn đề.

Automatic1111 đã dừng phát hành, ComfyUI thành lựa chọn mặc định

Đây là thay đổi lớn nhất mà các bài hướng dẫn tiếng Việt chưa cập nhật. Giao diện Automatic1111 WebUI, thứ mà gần như mọi bài viết về Stable Diffusion local đều dạy cài, có bản phát hành cuối cùng là 1.10.1 vào ngày 09/02/2025 và từ đó tới nay khoảng mười tám tháng không có bản mới. Hệ quả là nó không chạy được FLUX, không chạy được SD 3.5, cũng không chạy được Qwen-Image hay Z-Image.

Giao diện dựng luồng xử lý theo node trên màn hình laptop

Ở chiều ngược lại, ComfyUI ra bản 0.29.0 ngày 29/07/2026 với khoảng bốn mươi thay đổi chỉ trong một lần phát hành. Người dùng cần lưu ý kho mã nguồn đã chuyển sang tổ chức Comfy-Org, nên các hướng dẫn cũ trỏ về địa chỉ cá nhân của tác giả gốc giờ đã lỗi thời.

Ngoài ComfyUI, người chạy Stable Diffusion local còn vài lựa chọn đáng cân nhắc. SwarmUI bản 0.9.8 lấy luôn Z-Image-Turbo làm mô hình mặc định khi cài mới, phù hợp cho người muốn bắt đầu nhanh. Forge Neo là bản kế thừa của Forge cũ, chỉ hỗ trợ card NVIDIA và đặt sàn ở mức 6GB VRAM. Riêng InvokeAI thì mọi bản từ 6.13.6 trở về trước có lỗi rò rỉ tệp cấu hình chứa khoá API, cần cập nhật lên 6.13.7 trở lên.

Card tích hợp gánh được mô hình nào khi chạy Stable Diffusion local

Câu trả lời ngắn gọn là card tích hợp chạy được Stable Diffusion local, nhưng chỉ với nhóm mô hình nhỏ và phải chấp nhận đo thời gian bằng phút thay vì giây. Đây không còn là chuyện bất khả thi như hai năm trước, khi mọi mô hình đều đòi tối thiểu 8GB bộ nhớ đồ họa riêng.

Trên nhân đồ họa Intel Arc 140V thuộc dòng Core Ultra series 2, phép đo công khai cho ra 29 giây cho một ảnh 896×576 với 25 bước lấy mẫu. Nâng lên 1280×832 và giảm còn 20 bước thì thời gian vọt lên 2 phút 12 giây. Con số này đủ dùng để thử nghiệm câu lệnh nhưng không thể phục vụ công việc cần dựng hàng loạt.

So sánh điểm 3DMark Time Spy giữa nhân đồ họa tích hợp và card đồ họa rời

Khoảng cách thể hiện rõ qua điểm số đồ họa tổng hợp: nhân AMD Radeon 890M đạt 3.376 điểm Time Spy và 9.145 điểm Fire Strike, trong khi card rời thấp nhất trong nhóm dùng được là RTX 4050 Laptop đạt 8.125 điểm Time Spy và 21.949 điểm Fire Strike. Riêng phía AMD còn một rào cản khác là nền tảng tính toán ROCm vẫn chưa ổn định trên các dòng chip mới nhất, khiến nhiều người phải đi vòng qua Vulkan.

Nếu vẫn muốn thử Stable Diffusion local trên card tích hợp, lựa chọn hợp lý là Z-Image-Turbo 6 tỉ tham số ở bản nén 4-bit, hoặc FLUX.2-klein 4 tỉ tham số bản FP8. Cả hai đều nằm quanh mốc 6 tới 8GB bộ nhớ và cần rất ít bước lấy mẫu. Kỳ vọng thực tế nên đặt ở khoảng 20 tới 60 giây cho một ảnh 1024×1024.

Bộ nhớ hợp nhất, đường vòng khác để vượt rào VRAM

Nền tảng Apple Silicon giải bài toán bộ nhớ của Stable Diffusion local theo hướng hoàn toàn khác. Kiến trúc bộ nhớ hợp nhất cho phép bộ xử lý trung tâm, nhân đồ họa và nhân xử lý học sâu dùng chung một vùng nhớ tốc độ cao, nên không tồn tại khái niệm trần VRAM cố định như trên card rời.

Kiến trúc bộ nhớ hợp nhất cho phép nhân đồ họa dùng chung vùng nhớ với bộ xử lý

Kết quả thực tế trên một máy trang bị chip M4 Pro với 24GB bộ nhớ là khoảng 50 giây cho một ảnh FLUX kích thước 1024×1024, và 20 tới 40 giây cho SDXL ở 25 bước. Chậm hơn card rời cao cấp nhưng bù lại nạp được những mô hình mà card 8GB phải bỏ cuộc.

Đánh đổi nằm ở chỗ tốc độ chạy Stable Diffusion local vẫn thua card rời, và hệ sinh thái phần mềm hẹp hơn nhiều. Người dùng nền tảng này thường phải chọn các ứng dụng viết riêng cho Metal thay vì dùng chung công cụ với phần còn lại của cộng đồng, nên số lượng luồng xử lý dựng sẵn cũng ít hơn.

Cái bẫy 8GB khi chọn máy để chạy Stable Diffusion local

Thống kê 190 mẫu laptop có card đồ họa rời đang bày bán cho thấy một điều đáng lưu ý: nhóm có trần bộ nhớ đồ họa 8GB là nhóm đông nhất với 69 mẫu, gần bằng tổng của tất cả các nhóm còn lại cộng lại. Đây chính là mức mà phần lớn người mua máy chạy Stable Diffusion local rơi vào nếu chọn theo giá.

Vấn đề là nhóm 8GB đó trải dài từ 26,9 triệu tới hơn 78 triệu đồng. Nói cách khác, có những cấu hình đắt gấp ba lần mà dung lượng bộ nhớ đồ họa vẫn y nguyên, phần chênh lệch đi vào bộ xử lý, màn hình, độ mỏng và thương hiệu. Với người chạy Stable Diffusion local thì đó là khoản tiền không mua thêm được năng lực nào.

Trần bộ nhớ đồ họa Số mẫu máy Chạy được tới đâu
4GB 46 SD 1.5 và SDXL bản nén, phải hy sinh nhiều
6GB 27 SDXL đầy đủ, Z-Image và klein bản 4-bit
8GB 69 Z-Image và klein bản FP8, FLUX.1 bản 4-bit
12GB 9 FLUX.1-dev bản FP8, huấn luyện LoRA
16GB 29 klein 9B bản FP8, phần lớn mô hình hiện hành
24GB 2 FLUX.2-dev bản nén 4-bit

Một chi tiết dễ nhầm nữa là tên card không nói lên dung lượng. Cùng mang tên RTX 5070, bản dành cho laptop chỉ có 8GB trong khi bản máy bàn có 12GB. Tương tự, RTX 4080 bản laptop là 12GB còn bản máy bàn là 16GB. Người tra thông số trên mạng rất dễ lấy nhầm số của bản máy bàn rồi tưởng máy đang có dư dả.

Từ dữ liệu này rút ra một hướng chọn máy chạy Stable Diffusion local trái với trực giác: dòng máy trạm di động đời cũ lại là nơi mua dung lượng bộ nhớ đồ họa rẻ nhất. Ngược lại, máy trạm đời mới dùng card RTX PRO thế hệ Blackwell có giá tới 77 triệu mà vẫn chỉ 8GB. Chi tiết về cách đọc thông số card rời đời mới nằm trong bài RTX 5060 và RTX 5070 cho Laptop: Khi nào nên trả thêm tiền cho bản mạnh hơn?.

Ba mức bộ nhớ đồ họa và máy tương ứng theo tầm giá

Mức khởi điểm cho Stable Diffusion local là 6GB, đại diện có Lenovo LOQ Essential 15IAX9E (2024) giá 23.990.000₫ với card RTX 3050 6GB GDDR6, chip Core i5-12450HX, 16GB RAM DDR5 và SSD 512GB. Đây là ngưỡng thấp nhất còn chạy được SDXL đầy đủ cùng các mô hình 4 tới 6 tỉ tham số ở bản nén sâu.

Mức phổ biến 8GB có Lenovo LOQ 15AHP10 (2025) giá 33.990.000₫ dùng RTX 5050 8GB GDDR7 trên kiến trúc Blackwell, chip Ryzen 7 250 và 16GB RAM DDR5. Điểm đáng giá là card thế hệ Blackwell hỗ trợ định dạng nén NVFP4, thứ giúp giảm hơn một nửa dung lượng bộ nhớ mà các thế hệ trước không có.

Ba mức dung lượng bộ nhớ đồ họa của ba dòng card

Mức thoải mái 12GB có DELL Precision 5770 Mobile Workstation (2022) giá 30.900.000₫ với card RTX A3000 12GB GDDR6, chip Core i9-12900H, 32GB RAM DDR5 và SSD 1TB. Đây là minh hoạ trực tiếp cho luận điểm ở trên: nó rẻ hơn chiếc 8GB phía trước 3 triệu nhưng có thêm 4GB bộ nhớ đồ họa cùng gấp đôi RAM hệ thống.

Điểm cần cân nhắc ở chiếc máy trạm này là màn hình 17 inch, nặng 2,57kg và pin 97Wh, tức không phải máy để mang đi thường xuyên. Người ưu tiên di chuyển sẽ hợp với hai lựa chọn phía trên hơn, còn ai dựng ảnh tại chỗ thì phần bộ nhớ dôi ra đáng giá hơn nhiều so với vài trăm gram.

Câu hỏi thường gặp (FAQ)

Stable Diffusion còn đáng dùng năm 2026 không?

Còn, nhưng vai trò đã đổi. SD 1.5 và SDXL vẫn dẫn đầu về lượt tải nhờ kho LoRA và checkpoint cộng đồng tích luỹ suốt ba năm, nên chúng vẫn là lựa chọn tốt cho các phong cách đặc thù. Tuy nhiên bản mới nhất là SD 3.5 phát hành tháng 10/2024 đã thất bại về mức độ chấp nhận, còn Stability AI thì chuyển hướng sang mảng âm thanh và mô hình 3D. Với công việc dựng ảnh chính, phần lớn người dùng đã chuyển sang dòng FLUX hoặc Z-Image.

Cần bao nhiêu VRAM để chạy Stable Diffusion local?

Ngưỡng VRAM cho Stable Diffusion local tuỳ mô hình và mức nén chứ không có một con số chung. SDXL bản FP8 chỉ cần khoảng 5GB, còn bản nén 4-bit khoảng 4GB. Các mô hình đời 2026 như Z-Image-Turbo hay FLUX.2-klein cần khoảng 6GB ở bản 4-bit và khoảng 8GB ở bản FP8. Riêng FLUX.1-dev bản FP8 cần khoảng 12GB. Mốc 8GB hiện là ngưỡng đủ dùng cho hầu hết nhu cầu cá nhân, còn 12GB trở lên mới thoải mái cho công việc chuyên nghiệp và huấn luyện LoRA.

Vì sao không nên cài Automatic1111 nữa?

Vì bản phát hành cuối cùng của giao diện này là 1.10.1 vào ngày 09/02/2025 và tới nay đã khoảng mười tám tháng không có bản mới. Hệ quả là nó không hỗ trợ FLUX, SD 3.5, Qwen-Image hay Z-Image, tức toàn bộ các mô hình ra sau đầu năm 2025. Người mới tìm hiểu Stable Diffusion local nên bắt đầu thẳng với ComfyUI, hoặc SwarmUI nếu muốn giao diện đơn giản hơn. Các bài hướng dẫn tiếng Việt còn dạy cài Automatic1111 đều đã lỗi thời.

Card tích hợp có chạy nổi mô hình tạo ảnh không?

Card tích hợp chạy được Stable Diffusion local với mô hình nhỏ, nhưng thời gian tính bằng phút. Phép đo trên nhân Intel Arc 140V cho ra 29 giây với ảnh 896×576 ở 25 bước, và 2 phút 12 giây khi nâng lên 1280×832. Nếu chọn Z-Image-Turbo hoặc FLUX.2-klein ở bản nén sâu thì kỳ vọng hợp lý là 20 tới 60 giây cho một ảnh 1024×1024. Mức này đủ để thử câu lệnh và học cách dùng, nhưng không phục vụ được công việc cần dựng hàng loạt.

← Bài trước
Bài sau →

0 phản hồi cho “Chạy Stable Diffusion local: Bao nhiêu VRAM là đủ?”

Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *