Hướng dẫn cài đặt Ollama + Qwen trên Windows sử dụng GPU NVIDIA
Bạn muốn chạy AI (chatbot như ChatGPT) ngay trên máy tính cá nhân, miễn phí, không cần internet, không lo lộ dữ liệu? Ollama là công cụ giúp bạn làm điều đó chỉ trong vài phút. Bài viết này hướng dẫn chi tiết cách cài Ollama trên Windows và chạy mô hình AI Qwen (một trong những model mã nguồn mở mạnh nhất hiện nay) với GPU NVIDIA để tăng tốc xử lý.
💡 Mẹo: Nếu bạn cần triển khai AI cho doanh nghiệp một cách chuyên nghiệp, ổn định, không phải tự mày mò kỹ thuật, tham khảo giải pháp trọn gói tại FastSolutionNow.
Mục lục
- Yêu cầu hệ thống
- Bước 1: Tải và cài đặt Ollama
- Bước 2: Kiểm tra GPU NVIDIA được nhận diện
- Bước 3: Tải và chạy mô hình Qwen
- Bước 4: Chọn phiên bản Qwen phù hợp với GPU
- Lỗi thường gặp và cách khắc phục
- Tổng kết
1. Yêu cầu hệ thống
Trước khi cài đặt, kiểm tra máy tính đáp ứng các yêu cầu sau:
- Hệ điều hành: Windows 10 (bản 1903 trở lên) hoặc Windows 11
- RAM: tối thiểu 8GB (khuyến nghị 16GB trở lên)
- GPU: card NVIDIA có compute capability 5.0+ (hầu hết GPU từ dòng GTX 900 series trở lên). Ollama tự nhận diện GPU qua CUDA, không cần cài riêng CUDA Toolkit — Ollama đã tích hợp sẵn
- Driver NVIDIA: cập nhật driver Game Ready hoặc Studio mới nhất (từ phiên bản 527 trở lên)
- Ổ cứng trống: tối thiểu 10-20GB tùy model AI bạn muốn chạy
2. Bước 1: Tải và cài đặt Ollama
Bước 2.1 — Truy cập trang tải chính thức: ollama.com/download/windows. Luôn tải từ trang chính thức để đảm bảo an toàn, không dùng bản chia sẻ trôi nổi.
Bước 2.2 — Chạy file OllamaSetup.exe vừa tải về (dung lượng rất nhẹ, chỉ khoảng 5MB). Không cần quyền quản trị viên (admin) để cài.
⚠️ Nếu Windows hiện cảnh báo SmartScreen “Windows protected your PC”, đây là cảnh báo bình thường với các phần mềm chưa đăng ký chữ ký số rộng rãi. Nhấn More info → Run anyway để tiếp tục (vì bạn tải từ trang chính thức nên hoàn toàn an toàn).
Bước 2.3 — Sau khi cài xong, Ollama tự động chạy nền dưới dạng system tray app (biểu tượng nhỏ ở góc dưới màn hình, gần đồng hồ).
Bước 2.4 — Mở PowerShell hoặc Command Prompt, gõ lệnh sau để kiểm tra cài đặt thành công:
ollama --version
Nếu hiện ra số phiên bản (ví dụ ollama version is 0.32.x), nghĩa là bạn đã cài đặt thành công.
3. Bước 2: Kiểm tra GPU NVIDIA được nhận diện
Trước khi chạy model, nên xác nhận Ollama đã “thấy” GPU NVIDIA của bạn để tận dụng tốc độ xử lý nhanh hơn CPU từ 5 đến 10 lần.
Gõ lệnh:
nvidia-smi
Lệnh này hiển thị thông tin GPU, driver, và dung lượng VRAM đang dùng. Nếu ra bảng thông tin card NVIDIA, tức là driver đã hoạt động tốt.
4. Bước 3: Tải và chạy mô hình Qwen
Qwen là dòng mô hình AI mã nguồn mở của Alibaba, được đánh giá là một trong những lựa chọn tốt nhất để chạy AI ngay trên máy cá nhân năm 2026 nhờ hiệu năng cao và giấy phép Apache 2.0 (miễn phí sử dụng thương mại).
Bước 4.1 — Gõ lệnh sau để tải và chạy Qwen (bản 8B — phù hợp với GPU phổ thông 8GB VRAM):
ollama pull qwen3:8b
ollama run qwen3:8b
Lần đầu chạy sẽ mất vài phút để tải model (khoảng 5-6GB), các lần sau sẽ khởi động gần như tức thì.
Bước 4.2 — Sau khi tải xong, bạn có thể chat trực tiếp ngay trong cửa sổ dòng lệnh:
ollama ps
Nếu cột PROCESSOR hiển thị GPU (thay vì CPU), nghĩa là bạn đã tận dụng thành công card đồ họa NVIDIA để tăng tốc.
5. Bước 4: Chọn phiên bản Qwen phù hợp với GPU
Chọn đúng phiên bản giúp máy chạy mượt mà, tránh bị đầy VRAM. Tham khảo bảng dưới:
| VRAM GPU | Model nên chọn | Lệnh cài |
|---|---|---|
| 6-8GB (VD: RTX 3060, 4060) | Qwen3 8B | ollama pull qwen3:8b |
| 12-16GB (VD: RTX 4070Ti, 4080) | Qwen3 14B | ollama pull qwen3:14b |
| 24GB (VD: RTX 4090, 5090) | Qwen3 32B hoặc Qwen3.8-27B | ollama pull qwen3:32b |
| Không có GPU rời | Qwen3 0.6B (chạy CPU, chậm hơn) | ollama pull qwen3:0.6b |
Nếu bạn cần AI hỗ trợ lập trình, nên dùng riêng dòng qwen3-coder (VD:
ollama pull qwen3-coder:30b) — được tối ưu cho code, xử lý được ngữ cảnh (context) rất dài, phù hợp cho công việc dev.
6. Lỗi thường gặp và cách khắc phục
Lỗi “ollama không được nhận diện là lệnh” → PATH chưa được cập nhật trong phiên terminal hiện tại. Đóng hết cửa sổ PowerShell/CMD đang mở, mở lại cửa sổ mới.
GPU không được sử dụng (cột PROCESSOR luôn hiện CPU) → Kiểm tra driver NVIDIA đã cập nhật bản mới nhất (từ 527 trở lên). Vào Device Manager kiểm tra GPU có đang hoạt động bình thường không.
Lỗi cổng bị chiếm dụng (port 11434) → Có phần mềm khác đang dùng cổng này. Kiểm tra bằng lệnh:
netstat -ano | findstr 11434
7. Tổng kết
Chỉ với vài bước đơn giản, bạn đã có thể chạy AI ngay trên máy tính cá nhân, hoàn toàn miễn phí và bảo mật dữ liệu (không gửi thông tin ra internet). Đây là bước khởi đầu tuyệt vời để tìm hiểu và ứng dụng AI vào công việc hàng ngày.
Nếu doanh nghiệp/bộ phận của bạn cần triển khai giải pháp AI bài bản hơn (tích hợp vào quy trình làm việc, bảo mật, hỗ trợ kỹ thuật liên tục), đội ngũ FastSolutionNow sẵn sàng tư vấn và triển khai trọn gói.
Bạn cũng có thể trải nghiệm các phần mềm tiện ích được tối ưu sẵn tại soft.fastsolutioncom.com — dùng thử miễn phí trước khi quyết định.










Bình luận