Câu hỏi đầu tiên của người muốn chạy Stable Diffusion local luôn là máy cần bao nhiêu VRAM. Đáp án ngắn gọn: 4GB đủ cho SDXL bản nén sâu, 8GB chạy được các mô hình đời 2026, còn từ 12GB trở lên mới thật sự thoải mái. Nhưng con số đó chỉ đúng khi chọn đúng mô hình và đúng bản nén, và đây chính là chỗ phần lớn hướng dẫn tiếng Việt đang lạc hậu. Chúng vẫn dạy cài Automatic1111, giao diện đã ngừng phát hành từ tháng 2/2025 và không chạy nổi bất kỳ mô hình nào ra sau đó.
Bản đồ mô hình tạo ảnh 2026 đã đổi, Stable Diffusion không còn dẫn đầu
Điều ít bài viết về Stable Diffusion local nhắc tới là Stability AI đã gần như rời khỏi cuộc đua mô hình ảnh mã nguồn mở. Mô hình tạo ảnh mới nhất của hãng vẫn là Stable Diffusion 3.5 phát hành tháng 10/2024, còn toàn bộ sản phẩm năm 2025 và 2026 của họ chuyển sang mảng âm thanh và mô hình 3D. Không có phiên bản Stable Diffusion 4 nào tồn tại, dù một số trang tin tự động có đăng tin về nó.
Đáng chú ý hơn, chính SD 3.5 mới là bản thất bại. Thống kê lượt tải trong 30 ngày gần nhất cho thấy bản Medium đạt khoảng 101 nghìn và bản Large khoảng 60 nghìn, tức thua xa chính SDXL đời 2023 với 1,5 triệu lượt. Người chạy Stable Diffusion local đã bỏ qua thế hệ mới của Stability để chuyển sang hai dòng mô hình khác.
| Mô hình | Phát hành | Số tham số | Lượt tải 30 ngày |
|---|---|---|---|
| FLUX.2-dev | 11/2025 | 32 tỉ | 1,35 triệu |
| Z-Image-Turbo | 11/2025 | 6 tỉ | 1,16 triệu |
| Stable Diffusion 1.5 | 08/2022 | 0,9 tỉ | 1,68 triệu |
| Stable Diffusion XL | 07/2023 | 3,5 tỉ | 1,50 triệu |
| FLUX.2-klein 4B | 01/2026 | 4 tỉ | 387 nghìn |
| Stable Diffusion 3.5 Medium | 10/2024 | 2,5 tỉ | 101 nghìn |
Hai dòng thay thế là FLUX của Black Forest Labs và Z-Image của nhóm Tongyi thuộc Alibaba. FLUX.2-dev dẫn đầu về lượt tải, còn Z-Image-Turbo chỉ 6 tỉ tham số nhưng dùng giấy phép Apache 2.0 nên thoải mái cho mục đích thương mại, điều mà các bản dev của FLUX không cho phép.
Vậy vì sao SD 1.5 và SDXL vẫn đứng đầu bảng lượt tải? Vì hai mô hình này đã tích luỹ một kho LoRA và checkpoint cộng đồng khổng lồ suốt ba năm. Người chạy Stable Diffusion local hiện nay thường giữ chúng cho các phong cách đặc thù, còn công việc dựng ảnh chính thì chuyển sang mô hình mới. Đây là điểm mà các bài hướng dẫn cũ không phản ánh được.
Ngưỡng VRAM thực tế khi chạy Stable Diffusion local sau khi nén
Con số VRAM cho Stable Diffusion local thường được trích dẫn ở định dạng gốc BF16, và nó khiến nhiều người kết luận sai rằng máy đang có không chạy nổi. Thực tế mọi mô hình hiện hành đều có bản nén sẵn, và chính nhà phát hành cũng đưa ra bản FP8 ngay trong ngày ra mắt chứ không để cộng đồng tự làm như giai đoạn trước.
Black Forest Labs công bố con số cụ thể cho hai mức nén: định dạng FP8 chạy nhanh hơn 1,6 lần và giảm 40% dung lượng bộ nhớ, còn NVFP4 dành cho card RTX 50 series nhanh hơn 2,7 lần và giảm tới 55%. Đây là khác biệt đủ lớn để đổi hẳn nhóm phần cứng chạy được Stable Diffusion local.
| Mô hình | Bản gốc BF16 | Bản FP8 | Bản nén 4-bit |
|---|---|---|---|
| Stable Diffusion XL | khoảng 8GB | khoảng 5GB | khoảng 4GB |
| FLUX.2-klein 4B | khoảng 13GB | khoảng 8GB | khoảng 6GB |
| Z-Image-Turbo 6B | 14 tới 16GB | khoảng 8GB | khoảng 6GB |
| FLUX.1-dev 12B | khoảng 24GB | khoảng 12GB | khoảng 7GB |
| FLUX.2-dev 32B | trên 64GB | khoảng 32GB | khoảng 19GB |
Có một cơ chế nữa giải thích vì sao card 16GB vẫn nạp được mô hình nặng hơn 16GB. Giao diện ComfyUI nạp bộ mã hoá văn bản trước, mã hoá xong câu lệnh thì giải phóng nó khỏi bộ nhớ rồi mới nạp phần dựng ảnh. Đỉnh tiêu thụ vì thế bằng phần lớn hơn trong hai khối chứ không phải tổng của cả hai.
Điều này quan trọng với người chạy Stable Diffusion local vì các mô hình đời mới dùng bộ mã hoá văn bản rất nặng. FLUX.2 gọi sang một mô hình ngôn ngữ 24 tỉ tham số chỉ để hiểu câu lệnh, còn Krea 2 dùng bản 4 tỉ tham số. Nếu tính gộp cả hai khối thì gần như không laptop nào chạy nổi, nhưng trên thực tế cơ chế nạp luân phiên đã giải quyết phần lớn vấn đề.
Automatic1111 đã dừng phát hành, ComfyUI thành lựa chọn mặc định
Đây là thay đổi lớn nhất mà các bài hướng dẫn tiếng Việt chưa cập nhật. Giao diện Automatic1111 WebUI, thứ mà gần như mọi bài viết về Stable Diffusion local đều dạy cài, có bản phát hành cuối cùng là 1.10.1 vào ngày 09/02/2025 và từ đó tới nay khoảng mười tám tháng không có bản mới. Hệ quả là nó không chạy được FLUX, không chạy được SD 3.5, cũng không chạy được Qwen-Image hay Z-Image.
Ở chiều ngược lại, ComfyUI ra bản 0.29.0 ngày 29/07/2026 với khoảng bốn mươi thay đổi chỉ trong một lần phát hành. Người dùng cần lưu ý kho mã nguồn đã chuyển sang tổ chức Comfy-Org, nên các hướng dẫn cũ trỏ về địa chỉ cá nhân của tác giả gốc giờ đã lỗi thời.
Ngoài ComfyUI, người chạy Stable Diffusion local còn vài lựa chọn đáng cân nhắc. SwarmUI bản 0.9.8 lấy luôn Z-Image-Turbo làm mô hình mặc định khi cài mới, phù hợp cho người muốn bắt đầu nhanh. Forge Neo là bản kế thừa của Forge cũ, chỉ hỗ trợ card NVIDIA và đặt sàn ở mức 6GB VRAM. Riêng InvokeAI thì mọi bản từ 6.13.6 trở về trước có lỗi rò rỉ tệp cấu hình chứa khoá API, cần cập nhật lên 6.13.7 trở lên.
Card tích hợp gánh được mô hình nào khi chạy Stable Diffusion local
Câu trả lời ngắn gọn là card tích hợp chạy được Stable Diffusion local, nhưng chỉ với nhóm mô hình nhỏ và phải chấp nhận đo thời gian bằng phút thay vì giây. Đây không còn là chuyện bất khả thi như hai năm trước, khi mọi mô hình đều đòi tối thiểu 8GB bộ nhớ đồ họa riêng.
Trên nhân đồ họa Intel Arc 140V thuộc dòng Core Ultra series 2, phép đo công khai cho ra 29 giây cho một ảnh 896×576 với 25 bước lấy mẫu. Nâng lên 1280×832 và giảm còn 20 bước thì thời gian vọt lên 2 phút 12 giây. Con số này đủ dùng để thử nghiệm câu lệnh nhưng không thể phục vụ công việc cần dựng hàng loạt.

Khoảng cách thể hiện rõ qua điểm số đồ họa tổng hợp: nhân AMD Radeon 890M đạt 3.376 điểm Time Spy và 9.145 điểm Fire Strike, trong khi card rời thấp nhất trong nhóm dùng được là RTX 4050 Laptop đạt 8.125 điểm Time Spy và 21.949 điểm Fire Strike. Riêng phía AMD còn một rào cản khác là nền tảng tính toán ROCm vẫn chưa ổn định trên các dòng chip mới nhất, khiến nhiều người phải đi vòng qua Vulkan.
Nếu vẫn muốn thử Stable Diffusion local trên card tích hợp, lựa chọn hợp lý là Z-Image-Turbo 6 tỉ tham số ở bản nén 4-bit, hoặc FLUX.2-klein 4 tỉ tham số bản FP8. Cả hai đều nằm quanh mốc 6 tới 8GB bộ nhớ và cần rất ít bước lấy mẫu. Kỳ vọng thực tế nên đặt ở khoảng 20 tới 60 giây cho một ảnh 1024×1024.
Bộ nhớ hợp nhất, đường vòng khác để vượt rào VRAM
Nền tảng Apple Silicon giải bài toán bộ nhớ của Stable Diffusion local theo hướng hoàn toàn khác. Kiến trúc bộ nhớ hợp nhất cho phép bộ xử lý trung tâm, nhân đồ họa và nhân xử lý học sâu dùng chung một vùng nhớ tốc độ cao, nên không tồn tại khái niệm trần VRAM cố định như trên card rời.

Kết quả thực tế trên một máy trang bị chip M4 Pro với 24GB bộ nhớ là khoảng 50 giây cho một ảnh FLUX kích thước 1024×1024, và 20 tới 40 giây cho SDXL ở 25 bước. Chậm hơn card rời cao cấp nhưng bù lại nạp được những mô hình mà card 8GB phải bỏ cuộc.
Đánh đổi nằm ở chỗ tốc độ chạy Stable Diffusion local vẫn thua card rời, và hệ sinh thái phần mềm hẹp hơn nhiều. Người dùng nền tảng này thường phải chọn các ứng dụng viết riêng cho Metal thay vì dùng chung công cụ với phần còn lại của cộng đồng, nên số lượng luồng xử lý dựng sẵn cũng ít hơn.
Cái bẫy 8GB khi chọn máy để chạy Stable Diffusion local
Thống kê 190 mẫu laptop có card đồ họa rời đang bày bán cho thấy một điều đáng lưu ý: nhóm có trần bộ nhớ đồ họa 8GB là nhóm đông nhất với 69 mẫu, gần bằng tổng của tất cả các nhóm còn lại cộng lại. Đây chính là mức mà phần lớn người mua máy chạy Stable Diffusion local rơi vào nếu chọn theo giá.
Vấn đề là nhóm 8GB đó trải dài từ 26,9 triệu tới hơn 78 triệu đồng. Nói cách khác, có những cấu hình đắt gấp ba lần mà dung lượng bộ nhớ đồ họa vẫn y nguyên, phần chênh lệch đi vào bộ xử lý, màn hình, độ mỏng và thương hiệu. Với người chạy Stable Diffusion local thì đó là khoản tiền không mua thêm được năng lực nào.
| Trần bộ nhớ đồ họa | Số mẫu máy | Chạy được tới đâu |
|---|---|---|
| 4GB | 46 | SD 1.5 và SDXL bản nén, phải hy sinh nhiều |
| 6GB | 27 | SDXL đầy đủ, Z-Image và klein bản 4-bit |
| 8GB | 69 | Z-Image và klein bản FP8, FLUX.1 bản 4-bit |
| 12GB | 9 | FLUX.1-dev bản FP8, huấn luyện LoRA |
| 16GB | 29 | klein 9B bản FP8, phần lớn mô hình hiện hành |
| 24GB | 2 | FLUX.2-dev bản nén 4-bit |
Một chi tiết dễ nhầm nữa là tên card không nói lên dung lượng. Cùng mang tên RTX 5070, bản dành cho laptop chỉ có 8GB trong khi bản máy bàn có 12GB. Tương tự, RTX 4080 bản laptop là 12GB còn bản máy bàn là 16GB. Người tra thông số trên mạng rất dễ lấy nhầm số của bản máy bàn rồi tưởng máy đang có dư dả.
Từ dữ liệu này rút ra một hướng chọn máy chạy Stable Diffusion local trái với trực giác: dòng máy trạm di động đời cũ lại là nơi mua dung lượng bộ nhớ đồ họa rẻ nhất. Ngược lại, máy trạm đời mới dùng card RTX PRO thế hệ Blackwell có giá tới 77 triệu mà vẫn chỉ 8GB. Chi tiết về cách đọc thông số card rời đời mới nằm trong bài RTX 5060 và RTX 5070 cho Laptop: Khi nào nên trả thêm tiền cho bản mạnh hơn?.
Ba mức bộ nhớ đồ họa và máy tương ứng theo tầm giá
Mức khởi điểm cho Stable Diffusion local là 6GB, đại diện có Lenovo LOQ Essential 15IAX9E (2024) giá 23.990.000₫ với card RTX 3050 6GB GDDR6, chip Core i5-12450HX, 16GB RAM DDR5 và SSD 512GB. Đây là ngưỡng thấp nhất còn chạy được SDXL đầy đủ cùng các mô hình 4 tới 6 tỉ tham số ở bản nén sâu.
Mức phổ biến 8GB có Lenovo LOQ 15AHP10 (2025) giá 33.990.000₫ dùng RTX 5050 8GB GDDR7 trên kiến trúc Blackwell, chip Ryzen 7 250 và 16GB RAM DDR5. Điểm đáng giá là card thế hệ Blackwell hỗ trợ định dạng nén NVFP4, thứ giúp giảm hơn một nửa dung lượng bộ nhớ mà các thế hệ trước không có.
Mức thoải mái 12GB có DELL Precision 5770 Mobile Workstation (2022) giá 30.900.000₫ với card RTX A3000 12GB GDDR6, chip Core i9-12900H, 32GB RAM DDR5 và SSD 1TB. Đây là minh hoạ trực tiếp cho luận điểm ở trên: nó rẻ hơn chiếc 8GB phía trước 3 triệu nhưng có thêm 4GB bộ nhớ đồ họa cùng gấp đôi RAM hệ thống.
Điểm cần cân nhắc ở chiếc máy trạm này là màn hình 17 inch, nặng 2,57kg và pin 97Wh, tức không phải máy để mang đi thường xuyên. Người ưu tiên di chuyển sẽ hợp với hai lựa chọn phía trên hơn, còn ai dựng ảnh tại chỗ thì phần bộ nhớ dôi ra đáng giá hơn nhiều so với vài trăm gram.
Câu hỏi thường gặp (FAQ)
Stable Diffusion còn đáng dùng năm 2026 không?
Còn, nhưng vai trò đã đổi. SD 1.5 và SDXL vẫn dẫn đầu về lượt tải nhờ kho LoRA và checkpoint cộng đồng tích luỹ suốt ba năm, nên chúng vẫn là lựa chọn tốt cho các phong cách đặc thù. Tuy nhiên bản mới nhất là SD 3.5 phát hành tháng 10/2024 đã thất bại về mức độ chấp nhận, còn Stability AI thì chuyển hướng sang mảng âm thanh và mô hình 3D. Với công việc dựng ảnh chính, phần lớn người dùng đã chuyển sang dòng FLUX hoặc Z-Image.
Cần bao nhiêu VRAM để chạy Stable Diffusion local?
Ngưỡng VRAM cho Stable Diffusion local tuỳ mô hình và mức nén chứ không có một con số chung. SDXL bản FP8 chỉ cần khoảng 5GB, còn bản nén 4-bit khoảng 4GB. Các mô hình đời 2026 như Z-Image-Turbo hay FLUX.2-klein cần khoảng 6GB ở bản 4-bit và khoảng 8GB ở bản FP8. Riêng FLUX.1-dev bản FP8 cần khoảng 12GB. Mốc 8GB hiện là ngưỡng đủ dùng cho hầu hết nhu cầu cá nhân, còn 12GB trở lên mới thoải mái cho công việc chuyên nghiệp và huấn luyện LoRA.
Vì sao không nên cài Automatic1111 nữa?
Vì bản phát hành cuối cùng của giao diện này là 1.10.1 vào ngày 09/02/2025 và tới nay đã khoảng mười tám tháng không có bản mới. Hệ quả là nó không hỗ trợ FLUX, SD 3.5, Qwen-Image hay Z-Image, tức toàn bộ các mô hình ra sau đầu năm 2025. Người mới tìm hiểu Stable Diffusion local nên bắt đầu thẳng với ComfyUI, hoặc SwarmUI nếu muốn giao diện đơn giản hơn. Các bài hướng dẫn tiếng Việt còn dạy cài Automatic1111 đều đã lỗi thời.
Card tích hợp có chạy nổi mô hình tạo ảnh không?
Card tích hợp chạy được Stable Diffusion local với mô hình nhỏ, nhưng thời gian tính bằng phút. Phép đo trên nhân Intel Arc 140V cho ra 29 giây với ảnh 896×576 ở 25 bước, và 2 phút 12 giây khi nâng lên 1280×832. Nếu chọn Z-Image-Turbo hoặc FLUX.2-klein ở bản nén sâu thì kỳ vọng hợp lý là 20 tới 60 giây cho một ảnh 1024×1024. Mức này đủ để thử câu lệnh và học cách dùng, nhưng không phục vụ được công việc cần dựng hàng loạt.







0 phản hồi cho “Chạy Stable Diffusion local: Bao nhiêu VRAM là đủ?”