Cài LM Studio chỉ mất vài phút và tải một mô hình cũng chỉ cần bấm nút, nhưng rất nhiều người dùng thấy máy trả lời chậm rồi kết luận cấu hình không đủ. Thực tế phần lớn trường hợp là do ba thiết lập trong chính phần mềm để nguyên mặc định: số lớp đưa lên card đồ họa, độ dài ngữ cảnh và mức lượng tử hoá của mô hình. Bài này đi vào cách chỉnh ba thứ đó, cách chọn mô hình cho đúng dung lượng máy, và thời điểm nên chuyển sang công cụ khác.
LM Studio là gì và vì sao nó dễ bắt đầu hơn công cụ khác
LM Studio là ứng dụng máy tính cho phép tải và chạy mô hình ngôn ngữ ngay trên thiết bị, không gửi nội dung lên máy chủ nào. Bản hiện tại là 0.4.20 phát hành ngày 22/07/2026. Điểm khiến nó dễ tiếp cận là mọi thao tác đều nằm trong giao diện: tìm mô hình, xem dung lượng tệp, chọn mức nén, chỉnh tham số và trò chuyện, không phải gõ một dòng lệnh nào. Bộ cài lấy tại trang tải chính thức của LM Studio.
| Thiết lập | Mặc định hay gặp | Ảnh hưởng nếu để nguyên |
|---|---|---|
| Số lớp đưa lên GPU | Chỉ nạp một phần, phần còn lại chạy bằng CPU | Tốc độ rơi xuống mức của CPU dù máy có card rời |
| Độ dài ngữ cảnh | Đặt cao hơn nhu cầu thực tế | Ăn thêm bộ nhớ đồ họa, đẩy mô hình tràn ra RAM |
| Mức lượng tử hoá | Chọn bản nặng nhất trong danh sách | Tệp không lọt vừa bộ nhớ card, phải chia đôi tải |
Về giấy phép, phần mềm thuộc mã nguồn đóng nhưng miễn phí, và từ ngày 08/07/2025 đã miễn phí cả khi dùng trong môi trường công ty, không còn phải điền biểu mẫu xin phép như giai đoạn trước. Chỉ nhóm doanh nghiệp cần đăng nhập tập trung và quản lý quyền truy cập mô hình mới phải mua gói riêng.
Cần hiểu rằng LM Studio không tự sinh ra câu trả lời. Nó là lớp giao diện gọi xuống engine bên dưới, chủ yếu là llama.cpp cho định dạng GGUF trên Windows và Linux, còn trên máy Apple thì dùng MLX. Điều này giải thích vì sao cùng một mô hình chạy trên LM Studio hay công cụ khác đều cho chất lượng như nhau, và vì sao thiết lập mới là thứ tạo khác biệt.
Chỉnh số lớp đưa lên GPU trong LM Studio là việc làm đầu tiên
Đây là nguyên nhân phổ biến nhất khiến máy có card rời mà vẫn chạy chậm như không có. Mô hình được chia thành nhiều lớp, và phần mềm cho phép chọn bao nhiêu lớp nạp vào bộ nhớ card đồ họa, phần còn lại để CPU xử lý. Nếu chỉ một nửa số lớp lên card, tốc độ tổng thể bị kéo về gần mức của phần chậm nhất.
Cách chỉnh nằm ở bảng thiết lập bên phải khi nạp mô hình, mục điều khiển GPU. Nguyên tắc là đẩy càng nhiều lớp lên card càng tốt, miễn tổng dung lượng vẫn nhỏ hơn bộ nhớ card khoảng 1 đến 2GB để chừa chỗ cho ngữ cảnh. Nếu đẩy quá tay, phần mềm sẽ báo lỗi hết bộ nhớ hoặc tự lùi về CPU, lúc đó giảm bớt vài lớp rồi thử lại.

Khác biệt giữa hai trạng thái này lớn hơn nhiều so với hình dung của đa số người dùng. Trên phép đo công khai với một mô hình 8B nén 4-bit, cấu hình chạy hoàn toàn bằng card rời cho khoảng 36 token mỗi giây, còn cùng mô hình đó xử lý bằng bộ xử lý chỉ còn quanh 8 token mỗi giây.
Nhưng con số đáng chú ý hơn là thời gian chờ câu trả lời đầu tiên: 3,58 giây khi chạy bằng card so với 69,35 giây khi chạy bằng bộ xử lý. Chênh gần hai mươi lần, và đây mới là thứ khiến người dùng tưởng máy bị treo. Nếu bạn thấy phần mềm im lặng cả phút sau khi bấm gửi, khả năng cao mô hình đang không nằm trên card.
Chọn mô hình nào trong kho LM Studio cho đúng dung lượng máy
Mỗi mô hình trong kho đều có nhiều biến thể với mức nén khác nhau, ký hiệu bằng các đuôi như Q4, Q5 hay Q8. Số càng nhỏ thì tệp càng gọn và chạy càng nhanh, đổi lại chất lượng giảm nhẹ. Mức Q4 là điểm cân bằng được dùng phổ biến nhất, và một mô hình 8B ở mức này thường nặng khoảng 5GB.
Điểm dễ nhầm là dung lượng tệp không phải dung lượng bộ nhớ mà mô hình chiếm khi chạy. Ngoài trọng số còn phần bộ nhớ đệm cho ngữ cảnh hội thoại, tăng dần theo độ dài cuộc trò chuyện. Vì vậy nên chọn biến thể có dung lượng nhỏ hơn bộ nhớ card ít nhất 1 đến 2GB, thay vì chọn đúng bằng.

Về mô hình nên chọn giữa năm 2026, nhóm Gemma 4 ra mắt đầu tháng 4/2026 đang là lựa chọn hợp lý cho máy có 8GB bộ nhớ đồ họa, đặc biệt các bản đã được huấn luyện sẵn để nén. Một điểm đáng chú ý cho doanh nghiệp: Gemma 4 dùng giấy phép Apache 2.0, khác hẳn các thế hệ Gemma trước vốn ràng buộc bằng điều khoản riêng của Google.
Ngược lại, nhóm mô hình cũ như Llama 3.x, Mistral 7B và Qwen2.5 nên tránh vì đã có công cụ gắn cảnh báo ngừng hỗ trợ trong bản phát hành tháng 7/2026. Riêng dòng Llama còn một ràng buộc pháp lý ít người để ý: nó không phải phần mềm nguồn mở mà dùng giấy phép cộng đồng riêng, kèm điều khoản cấm dùng để huấn luyện mô hình cạnh tranh.
Độ dài ngữ cảnh và cách nó âm thầm ăn hết bộ nhớ
Ngữ cảnh là lượng chữ mà mô hình còn nhớ trong một cuộc trò chuyện, tính bằng token. Đặt cao thì mô hình nhớ được tài liệu dài, nhưng phần bộ nhớ đệm dành cho nó nằm chung chỗ với trọng số mô hình trên card đồ họa. Đặt 32 nghìn token trong khi chỉ hỏi đáp vài câu ngắn là cách lãng phí bộ nhớ nhanh nhất.
Cách làm hợp lý là đặt theo tác vụ thật. Hỏi đáp thông thường và viết nháp ngắn thì 4 nghìn token đã dư. Tóm tắt một tài liệu vài chục trang mới cần 16 nghìn trở lên, và khi đó nên chấp nhận giảm bớt số lớp trên card hoặc đổi sang biến thể mô hình nén sâu hơn để bù lại.

Dấu hiệu nhận ra ngữ cảnh đang quá tay khá rõ: cuộc trò chuyện chạy nhanh ở vài lượt đầu rồi chậm dần đều, hoặc phần mềm báo hết bộ nhớ giữa chừng. Đó là lúc bộ nhớ đệm phình lên tới mức đẩy một phần mô hình khỏi card. Bắt đầu lại cuộc trò chuyện mới sẽ giải phóng phần này.
Người dùng máy Apple có một lợi thế riêng ở đây. Từ đầu năm 2026, cả LM Studio lẫn các công cụ cùng nhóm đều đã chuyển sang engine MLX tối ưu cho chip Apple, cho tốc độ tốt hơn hẳn so với bản GGUF. Trên máy Mac nên ưu tiên chọn biến thể MLX của mô hình nếu kho có sẵn.
Bật máy chủ API trong LM Studio và giới hạn rủi ro
Ngoài cửa sổ trò chuyện, phần mềm còn có thể chạy như một máy chủ cung cấp giao diện lập trình tương thích chuẩn phổ biến, mặc định ở cổng 1234 và chỉ trên máy cục bộ. Nhờ vậy các công cụ khác trên cùng máy có thể gọi tới mô hình đang chạy mà không cần Internet.

Rủi ro xuất hiện khi người dùng đổi địa chỉ lắng nghe để máy khác trong mạng truy cập được. Một nghiên cứu công bố tháng 9/2025 quét Internet và tìm ra hơn một nghìn máy chủ mô hình cục bộ phơi ra ngoài, trong đó gần 19% đang nạp mô hình và trả lời yêu cầu mà không cần bất kỳ xác thực nào. Nghiên cứu đó liệt kê cả cổng 1234 của LM Studio trong danh sách bị quét.
Nguyên tắc an toàn khá đơn giản: giữ nguyên phạm vi cục bộ nếu chỉ dùng một máy, đặt sau một lớp trung gian có xác thực nếu buộc phải chia sẻ trong nhóm, và tắt máy chủ sau khi dùng xong. Với dữ liệu nhạy cảm còn nên tạo thư mục làm việc riêng thay vì trỏ phần mềm vào toàn bộ tài liệu.
Khi nào nên chuyển từ LM Studio sang công cụ dòng lệnh
LM Studio phát huy tốt nhất khi bạn còn đang thử nghiệm: đổi mô hình liên tục, so sánh vài biến thể nén, tinh chỉnh tham số rồi xem kết quả ngay. Giao diện giúp thấy được dung lượng, mức chiếm bộ nhớ và tốc độ mà không phải đọc dòng ghi chép nào.
Nhưng khi quy trình đã ổn định và cần lặp lại trên nhiều máy, hoặc cần nối mô hình vào công cụ viết mã và các tác vụ tự động, thì công cụ dòng lệnh thuận tiện hơn hẳn vì cấu hình có thể chép nguyên sang máy khác. Đây cũng là lúc nên cân nhắc phần mềm nguồn mở nếu tổ chức yêu cầu kiểm toán mã, điều mà LM Studio không đáp ứng được.
Về phần cứng, nếu thường xuyên phải giảm số lớp trên card hoặc hạ ngữ cảnh xuống dưới mức công việc cần, giới hạn đã nằm ở bộ nhớ đồ họa chứ không ở phần mềm. Ngưỡng bộ nhớ cho từng cỡ mô hình đã được phân tích riêng trong bài 16GB RAM có đủ chạy LLM offline.
Ở nhóm máy đang bán tại TP.HCM, Lenovo Legion Pro 5 16IAX10 giá 57.290.000 đồng là ví dụ đủ ngưỡng: Core Ultra 9 275HX, 32GB DDR5 5600 chia hai thanh, SSD 1TB PCIe Gen4 và RTX 5060 8GB GDDR7. Cấu hình này chạy trọn mô hình 8B nén 4-bit trên card mà vẫn còn chỗ cho ngữ cảnh dài, và bộ nhớ hai thanh còn nâng tiếp được nếu sau này muốn thử mô hình lớn hơn.
Câu hỏi thường gặp về LM Studio
LM Studio yêu cầu cấu hình máy như thế nào?
Phần mềm chạy được trên máy chỉ có bộ xử lý, nhưng trải nghiệm sẽ rất chậm ở khâu chờ câu trả lời đầu tiên. Để dùng thoải mái với mô hình 8B nén 4-bit, nên có card đồ họa rời 8GB và bộ nhớ hệ thống 32GB. Máy Apple dùng bộ nhớ hợp nhất thì mốc 24GB trở lên là hợp lý, và nên chọn biến thể MLX của mô hình.
Vì sao LM Studio chạy chậm dù máy có card đồ họa rời?
Nguyên nhân thường gặp nhất là số lớp đưa lên card đang để mặc định ở mức thấp, khiến phần lớn mô hình vẫn xử lý bằng bộ xử lý. Nguyên nhân thứ hai là độ dài ngữ cảnh đặt quá cao làm bộ nhớ đệm chiếm hết chỗ trống. Thứ ba là chọn biến thể mô hình nặng hơn dung lượng card. Kiểm tra ba mục này trước khi nghĩ tới việc nâng cấp máy.
LM Studio có miễn phí cho doanh nghiệp không?
Có. Từ ngày 08/07/2025, phần mềm miễn phí cả khi dùng trong công ty, không cần xin giấy phép thương mại. Chỉ gói dành cho tổ chức cần đăng nhập tập trung và kiểm soát quyền truy cập mô hình mới tính phí. Tuy vậy phần mềm vẫn thuộc mã nguồn đóng, nên nếu chính sách nội bộ yêu cầu kiểm toán mã thì cần tìm phương án nguồn mở.
Mô hình tải qua LM Studio có được dùng thương mại không?
Không mặc định. Giấy phép phần mềm và giấy phép mô hình là hai lớp độc lập. Dòng Llama dùng giấy phép cộng đồng riêng với nhiều ràng buộc, trong khi Gemma 4 ra tháng 4/2026 đã chuyển sang Apache 2.0 nên thoáng hơn nhiều. Trước khi triển khai, nên lưu lại tên tệp, phiên bản, nguồn tải và nội dung giấy phép tại thời điểm đó.
Bật máy chủ API trong LM Studio có an toàn không?
An toàn nếu giữ nguyên phạm vi cục bộ ở cổng 1234, vì khi đó thiết bị khác không truy cập được. Rủi ro chỉ xuất hiện khi đổi địa chỉ lắng nghe để chia sẻ trong mạng, do phần mềm nhóm này thường không có cơ chế xác thực sẵn. Nếu buộc phải chia sẻ, hãy đặt sau một lớp trung gian có xác thực và tắt máy chủ khi không dùng.





0 phản hồi cho “Làm chủ tốc độ LM Studio: 3 thiết lập mặc định đang kéo lùi dàn máy của bạn?”