All posts
Chạy AI ngay trên máy của bạn — không cần xin phép ai hết!

Chạy AI ngay trên máy của bạn — không cần xin phép ai hết!

Thai Le Q.'s avatarThai Le Q.
Table of Contents8 sections

Dạo này người ta đang nói rất nhiều về "local AI models" — tức là các model AI mà bạn tải về và chạy thẳng trên máy tính của mình, thay vì phải gọi API của ChatGPT hay Claude qua internet. Nghe có vẻ phức tạp, nhưng thực ra không đáng sợ đến vậy đâu. Và có một vài lý do khá thú vị để bạn thử ít nhất một lần.

Cơn hoảng loạn "AI sẽ bị chặn" có thật không?

Gần đây có một số sự kiện khiến người dùng lo lắng: Claude Fable 5 xuất hiện vài ngày rồi bị pull xuống, ChatGPT 5.6 chỉ cho một số đối tác chính phủ của Mỹ dùng, Mythos 5 thì còn hạn chế hơn nữa. Tự nhiên mọi người bắt đầu hỏi: "Ủa, nếu mai mốt họ chặn hết thì sao?"

Câu trả lời thực tế là: khả năng bạn bị mất hoàn toàn quyền truy cập vào cloud AI là... khá thấp. Bạn vẫn sẽ dùng được ChatGPT hay Claude dài dài. Nhưng câu chuyện local model hay hơn chỗ đó nhiều, nên cứ đọc tiếp đi!

GLM 5.2 — thứ đã thay đổi cuộc chơi

Trước đây, nếu ai đó hỏi "open model có đáng dùng không?" câu trả lời thường là: "Rẻ hơn thì có, nhưng kém hơn rõ rệt." Tức là bạn phải đánh đổi chất lượng lấy tiền.

Nhưng GLM 5.2 — model open source từ Z. AI của Trung Quốc — đã thay đổi điều đó. Performance của nó ngang ngửa GPT-5.5 và gần với Claude Opus 4.8, trong khi giá rẻ hơn khoảng 6 lần. Cái "khoảng cách chất lượng" vốn là lý do duy nhất để trả tiền cho cloud model... giờ gần như không còn nữa.

"Open" và "Local" — hai thứ khác nhau đó nhé

Trước khi đi tiếp, cần phân biệt hai khái niệm này vì hay bị nhầm:

  • Open model: weights được công bố công khai, ai cũng tải về và xem được bên trong. Khác với ChatGPT hay Claude — bạn không biết bên trong họ dùng gì.

  • Local model: bạn chạy model đó trên máy của mình, không phải gọi API qua internet.

Một model có thể vừa open vừa local (bạn tải GLM 5.2 về chạy), hoặc open nhưng không local (bạn gọi GLM 5.2 qua OpenRouter trên cloud). Hiểu được điểm này sẽ giúp bạn chọn đúng tool hơn.

5 lý do để thử chạy local

1. Miễn phí sau khi setup
Không có subscription hàng tháng. Mua phần cứng một lần, chạy mãi mãi.

2. Không bị rate limit
Bạn đã bao giờ đang làm việc ngon lành thì bị "You've reached your limit, try again in 3 hours" chưa? Local model không có chuyện đó.

3. Privacy tuyệt đối
Data không rời khỏi máy bạn. Không có server nào log lại những gì bạn hỏi AI.

4. Dùng được offline
Trên máy bay, mất mạng, ở nơi không có internet — model vẫn chạy bình thường.

5. Không ai lấy đi được
Đây là lý do thú vị nhất. Local model literally là một file trên máy bạn. Một khi đã download xong, không ai có thể bắt bạn xóa đi.

Các open model đáng chú ý nhất hiện tại

Như hình minh họa ở trên, mỗi model có thế mạnh riêng:

  • GLM 5.2 — mạnh nhất, giá rẻ nhất, nhưng to khủng khiếp (~744B params), khó chạy local nếu không có phần cứng xịn

  • DeepSeek V4 — cực rẻ, reasoning và coding nặng rất tốt, nhưng agent/tool use thì kém hơn

  • Kimi K2 — ngược lại với DeepSeek: tác vụ dài, multi-step, agentic workflow là điểm mạnh

  • Qwen 3 — có nhiều variant nhỏ chạy ngon trên laptop bình thường, đây là lựa chọn được khuyến nghị nhất nếu bạn muốn local

  • Gemma 4 (Google) — cực nhẹ, gần như chạy được trên bất kỳ máy nào

  • MiniMax M3 — xử lý tài liệu dài cực tốt

  • Mistral Devstral — lựa chọn nếu bạn muốn một thứ không phải từ Trung Quốc

Cần phần cứng gì?

Quy tắc đơn giản là: RAM càng nhiều = chạy được model càng to = kết quả càng tốt.

Model là động cơ, máy tính là thân xe. Động cơ to mà thân xe nhỏ thì không nhét vào được.

Thiết bị

Chi phí

Model size

Dùng được cho

Laptop phổ thông

Ví dụ bạn đang ở hữu

~7–8B

Viết lách, tác vụ nhẹ

Laptop 32GB RAM

~$1,800

~24–30B

Coding nghiêm túc

Mac Mini

~$2,000

~35B

Sweet spot cho local AI

Mac Studio 128GB

~$3,500

~235B

Gần bằng cloud models

3 cách chạy local/open model — từ dễ đến khó

Như hình minh họa ở trên:

🖥️ LM Studio — Dành cho mọi người

Cách dễ nhất, không cần biết code:

  1. Download LM Studio về

  2. Mở app, vào Model Search

  3. Chọn Gemma 4 hoặc Qwen 3 (nhẹ, chạy tốt trên laptop)

  4. Click Download → chờ → Use in New Chat

  5. Tắt wifi rồi chat thử — nó vẫn trả lời vì đang chạy hoàn toàn trên máy bạn!

☁️ OpenRouter — Không có máy mạnh thì dùng cái này

Nếu muốn dùng GLM 5.2 mà máy không đủ sức chạy local:

  1. Đăng ký OpenRouter

  2. Vào Chat interface, click Add model

  3. Tìm GLM 5.2, chọn và chat

Lưu ý: cách này vẫn là cloud, mất đi ưu điểm privacy và offline. Nhưng bù lại rẻ hơn ChatGPT/Claude rất nhiều.

⌨️ Ollama — Dành cho dev thích terminal

bash

# Cài đặt
brew install ollama

# Chạy model (tự tải về nếu chưa có)
ollama run qwen3

# Hoặc dùng Gemma nếu máy yếu hơn
ollama run gemma4

Ollama cũng có thể tích hợp vào code Python, Node.js, hay bất kỳ app nào bạn đang build — khá tiện cho developer.

Vậy có nên switch sang local hoàn toàn không?

Câu trả lời thật lòng: chưa nên — ít nhất là nếu bạn cần AI cho công việc nghiêm túc. Các cloud model hàng đầu như Claude Sonnet hay GPT-5 vẫn tốt hơn local model đáng kể ở coding phức tạp và reasoning nặng.

Nhưng điều được khuyến nghị là: dành 10–20 phút để setup một local model, chạy thử xem sao. Không tốn tiền, học được thêm về AI infrastructure, và bạn sẽ có một "cái lưới an toàn" phòng khi cloud AI bị giới hạn vì lý do nào đó.


Tóm lại: cứ dùng cloud AI cho việc quan trọng, nhưng thử local model một lần cho biết — vừa vui, vừa học được thêm, và biết đâu một ngày nào đó lại cần dùng đến thật!