Paperclip là control plane — không phải AI. Nó quản lý agents, giao task, track chi phí, enforce governance. Nhưng nó không “suy nghĩ” — phần đó thuộc về AI model mà bạn chọn gắn vào từng agent. Claude, GPT-4o, Gemini, Llama local — Paperclip chạy được với tất cả. Vấn đề là mỗi lựa chọn có trade-off khác nhau, và nếu bạn chọn sai model cho sai loại task, bạn sẽ trả nhiều tiền hơn cho kết quả kém hơn.

Nếu bạn đã đọc bài trước về task management, bạn biết cách giao việc cho AI team. Bài này trả lời câu hỏi tiếp theo: agent chạy bằng “bộ não” nào, và cách chọn model phù hợp cho từng vai trò trong team.


Paperclip không phải AI — và đó là điểm mạnh

Nhiều người lần đầu nghe về Paperclip sẽ hỏi: “Nó dùng GPT hay Claude?” Câu trả lời: cả hai. Hoặc không cái nào. Tùy bạn.

Paperclip là control plane — lớp quản lý nằm giữa con người và AI agents. Nó xử lý những thứ mà AI model không làm: tổ chức team (org chart), giao task (checkout), theo dõi tiến độ (heartbeat), kiểm soát chi phí (budget per agent), và audit trail cho mọi hành động. AI model xử lý phần “suy nghĩ” — viết code, phân tích requirement, tạo content.

Tách biệt control plane và AI model có ý nghĩa thực tế lớn. Bạn không bị lock-in vào 1 provider. Khi model mới ra — GPT-5, Claude tiếp theo, hay Gemini 3.0 — bạn thay 1 dòng config trong adapter, không cần viết lại workflow. Task lifecycle, org chart, quality gates — tất cả giữ nguyên.

Analogy đơn giản: Paperclip giống bộ phận HR và project management. AI model giống skill set của từng nhân viên. Bạn không thay đổi quy trình HR khi tuyển nhân viên mới biết thêm 1 ngôn ngữ lập trình — bạn chỉ cập nhật hồ sơ năng lực.

Đây là architecture mà bài đầu tiên trong series đã giới thiệu. Ở đây, bạn sẽ thấy nó hoạt động khi gắn các “bộ não” khác nhau.


Adapter — cầu nối giữa Paperclip và AI model

Mỗi agent trong Paperclip có 1 adapter — config định nghĩa agent chạy model nào, ở đâu, với giới hạn gì.

Adapter gồm: loại adapter (claude_local, openai, ollama…), tên model cụ thể, timeout, số turn tối đa mỗi heartbeat, và working directory. Khi Paperclip trigger heartbeat cho agent, nó dùng adapter để gọi đúng AI provider với đúng config.

Điều quan trọng: 1 team Paperclip có thể dùng nhiều adapters khác nhau. CTO dùng Claude Opus vì cần suy luận sâu khi review architecture. Frontend Engineer dùng GPT-4o vì response nhanh, tốt cho code generation. CMO dùng Claude Sonnet vì viết content dài, multi-language. Data Engineer dùng Llama local vì data khách hàng không được rời server.

Mỗi agent chạy model phù hợp nhất cho vai trò được giao. Paperclip quản lý tất cả như 1 team thống nhất — task routing, checkout, audit trail không phụ thuộc vào model bên dưới.

Thay adapter cho 1 agent = thay “bộ não” mà không ảnh hưởng team. Không cần migrate tasks, không cần đổi org chart, không cần báo các agents khác. Nếu bạn đã setup Paperclip theo bài hướng dẫn, adapter config nằm ngay trong bước tạo agent.


Claude — khi agent cần suy luận sâu và follow instruction chính xác

Claude của Anthropic là model mà nhiều team chọn cho agents cần thực thi protocol phức tạp. Lý do chính: instruction following.

Agents trong Paperclip không chat tự do. Chúng chạy theo protocol: wake up → check inbox → checkout task → làm việc theo brief → comment kết quả → exit. Protocol này có hàng chục quy tắc — khi nào set blocked, khi nào escalate, khi nào tạo subtask, format comment ra sao. Model nào follow instructions chính xác nhất sẽ tạo ra agent đáng tin cậy nhất.

Claude có 3 tier:

  • Opus — suy luận sâu nhất. Phù hợp cho CEO agent (orchestrate team phức tạp), CTO agent (code review, architecture decisions). Chậm hơn, đắt hơn, nhưng ít sai ở tasks đòi hỏi reasoning nhiều bước.
  • Sonnet — balance tốt nhất cho hầu hết agents. Nhanh hơn Opus, rẻ hơn đáng kể, đủ mạnh cho content writing, code generation, analysis. Đây là default choice cho phần lớn team.
  • Haiku — nhanh nhất, rẻ nhất. Tốt cho tasks đơn giản: format conversion, log parsing, status reporting.

Context window 200K tokens cho phép agent đọc codebase lớn hoặc document dài trong 1 lần. Đủ cho hầu hết use cases thực tế.

Trade-off rõ ràng: giá per token cao hơn GPT-4o, đặc biệt với Opus. Và Anthropic API availability không phải lúc nào cũng stable — peak hours có thể chậm.

Một điểm cần nêu: đây là model mà Paperclip team đang dùng chính. Agents viết bài này, agents review code, agents quản lý task — đều chạy Claude. Đó không phải recommendation, đó là transparency.


GPT-4o và o-series — tốc độ, ecosystem, và multimodal

OpenAI có lợi thế khó bỏ qua: ecosystem lớn nhất.

GPT-4o cho tốc độ response nhanh — quan trọng cho heartbeat efficiency. Mỗi heartbeat có timeout. Agent chạy model nhanh hơn = làm được nhiều hơn trong 1 heartbeat = tiết kiệm số lượng heartbeat per task = giảm chi phí tổng. Function calling và tool use của GPT-4o mature, documentation đầy đủ, libraries hỗ trợ mọi ngôn ngữ.

o1/o3 (o-series) là lựa chọn cho reasoning tasks nặng. Khi agent cần suy luận logic phức tạp — phân tích bug nhiều bước, thiết kế database schema, hay refactor architecture — o-series cho kết quả tốt. Nhưng chậm hơn và đắt hơn GPT-4o đáng kể.

GPT-4o-mini cho tasks không cần nhiều “suy nghĩ”: parse logs, format output, simple transformations. Rẻ nhất trong lineup OpenAI, nhanh, đủ dùng.

Phù hợp cho:

  • Frontend Engineer — code generation nhanh, tool calling tốt cho component scaffolding
  • QA agent — tốc độ quan trọng khi chạy nhiều test cases, multimodal đọc screenshots
  • Agents cần multimodal — GPT-4o đọc images, diagrams, UI screenshots tốt

Trade-off: instruction following cho protocol dài và phức tạp đôi khi kém chính xác hơn Claude. Agent GPT-4o có thể “sáng tạo” thêm bước ngoài protocol — điều bạn không muốn ở agents cần tuân thủ strict governance.


Gemini — context khổng lồ và tích hợp Google

Google Gemini chơi ở 1 chiều mà không ai khác cạnh tranh được: context window.

Gemini 2.5 Pro hỗ trợ context lên tới 1 triệu tokens — gấp 5 lần Claude, gấp 8 lần GPT-4o. Con số này có ý nghĩa thực tế: agent có thể đọc toàn bộ codebase của 1 project nhỏ-trung bình trong 1 lần, cross-reference giữa specs và implementation, so sánh 10 files cùng lúc mà không cần chunk.

Gemini 2.5 Flash cho tốc độ nhanh, giá competitive — thay thế tốt cho GPT-4o-mini ở tasks nhẹ.

Phù hợp cho:

  • BA agent — đọc specs dài, cross-reference giữa requirement documents
  • Data-AI engineer — phân tích datasets, đọc nhiều source files
  • Agents cần tổng hợp thông tin từ nhiều nguồn trong 1 lần

Tích hợp Google ecosystem (Vertex AI, Cloud services) là lợi thế nếu team đã dùng GCP.

Trade-off cần lưu ý: API cho agentic workflows chưa mature bằng OpenAI và Anthropic. Tool calling ecosystem đang phát triển nhưng chưa phong phú. Nếu agent của bạn cần nhiều tool integration phức tạp, Gemini có thể cần thêm effort setup.


Local models — khi privacy là ưu tiên số 1

Có những lúc cloud không phải option.

Khách hàng Nhật Bản có NDA nghiêm ngặt — data source code không được rời internal network. Dự án trong ngành tài chính hay y tế có compliance requirements (GDPR, SOC2, HIPAA). Hoặc đơn giản: bạn không muốn gửi proprietary code qua API của bên thứ 3.

Đây là lúc local models trở nên cần thiết. Với Ollama hoặc vLLM, bạn chạy AI model trên server riêng — data không bao giờ rời mạng nội bộ.

Models phổ biến cho self-hosting:

  • Llama 3.1 (Meta) — code generation tốt, general purpose mạnh, license cho phép commercial use
  • DeepSeek — coding mạnh, competitive với frontier models ở code tasks
  • Mistral — lightweight, nhanh, tốt cho tiếng Anh/Pháp
  • Qwen (Alibaba) — đa ngôn ngữ, tốt cho tiếng Trung và Asian languages

Setup với Paperclip: config adapter type = ollama, trỏ đến local server, chọn model. Không cần API key, không phụ thuộc cloud provider.

Trade-off không nhỏ: cần GPU (A100 hoặc H100 cho models 70B+ parameters), capability thấp hơn frontier models cho complex reasoning, và bạn tự quản infrastructure — updates, scaling, monitoring đều là trách nhiệm team.

Cách tiếp cận thực tế nhất: hybrid. Dùng local model cho agents xử lý data nhạy cảm (client source code, database). Dùng cloud model cho agents không chạm data khách hàng (content writing, research, internal tooling). Paperclip quản lý cả hai — cùng org chart, cùng task flow.


Bảng so sánh tổng hợp

Snapshot Q1 2026 — pricing và capability thay đổi nhanh, check documentation gốc từng provider trước khi quyết định.

Tiêu chíClaude (Anthropic)GPT-4o (OpenAI)Gemini (Google)Local (Llama/DeepSeek)
ReasoningXuất sắcTốt (o-series: rất tốt)TốtKhá
Instruction followingRất tốtTốtTốtTrung bình
SpeedTrung bìnhNhanhNhanhTùy hardware
Context window200K128K1M+32K–128K
Cost / 1M tokens$$$$$$$Hardware cost
PrivacyCloudCloudCloudFull local
Agentic maturityCaoCaoĐang phát triểnTùy model
MultimodalTốtRất tốtTốtHạn chế

Không có model nào “thắng” ở tất cả tiêu chí. Claude mạnh reasoning nhưng đắt. GPT-4o nhanh và ecosystem tốt nhưng instruction following không bằng. Gemini có context khổng lồ nhưng agentic tooling chưa mature. Local models cho privacy tuyệt đối nhưng cần đầu tư hardware và capability thấp hơn.

Lựa chọn đúng phụ thuộc vào: loại task, budget, yêu cầu privacy, và infrastructure hiện tại.


Khuyến nghị thực tế — chọn model theo vai trò agent

Không cần chọn 1 model cho cả team. Sức mạnh của Paperclip là cho phép bạn chọn theo vai trò:

  • CEO / Manager agents → Claude Opus hoặc Sonnet — cần instruction following chính xác nhất, orchestrate team phức tạp, quyết định multi-step
  • Code generation agents (Backend, Frontend) → Claude Sonnet hoặc GPT-4o — balance giữa quality và speed, tool calling cho IDE integration
  • QA / Testing agents → GPT-4o hoặc Gemini Flash — tốc độ quan trọng khi chạy nhiều test iterations, cost-effective
  • Content / Marketing agents → Claude Sonnet — viết tốt, multi-language (VI, EN, JA), tone control
  • Data processing agents → Gemini Pro (context lớn cho cross-reference) hoặc Local model (privacy cho client data)
  • Simple utility agents (format, parse, notify) → Haiku hoặc GPT-4o-mini — rẻ, nhanh, đủ dùng

Quy tắc thực tế: Bắt đầu với 1 model (Sonnet hoặc GPT-4o) cho cả team. Chạy 2 tuần. Đo cost per task, completion rate, và quality. Sau đó mới optimize từng agent — upgrade model cho agents đang underperform, downgrade cho agents đang overspend.

Đừng over-optimize sớm. Pricing thay đổi mỗi quý. Model mới ra liên tục. Adapter swap mất 1 phút — không phải quyết định vĩnh viễn.


Hybrid setup — sức mạnh thực sự của model-agnostic

Đây là scenario mà model-agnostic thể hiện giá trị rõ nhất.

Hãy hình dung 1 outsource team 5 agents chạy Paperclip:

  • CTO chạy Claude Opus — review architecture decisions, code review phức tạp, cần reasoning sâu nhất
  • 2 Backend Engineers chạy GPT-4o — code generation nhanh, function calling tốt, throughput cao
  • QA chạy Gemini Flash — chạy test nhanh, đọc test reports dài, giá rẻ
  • Data Engineer chạy Llama 3.1 local — xử lý source code và data khách hàng Nhật, không gửi qua cloud

5 agents, 4 models khác nhau, 1 team thống nhất. Cùng org chart, cùng task lifecycle, cùng audit trail. CTO giao task cho Backend Engineer — không cần biết Backend chạy GPT hay Claude. QA nhận task review từ CTO — không cần biết CTO dùng model nào. Paperclip quản lý flow, không quản lý model.

Khi model mới ra: swap adapter cho 1 agent, test 1 sprint, đánh giá kết quả. Nếu tốt hơn → roll out. Nếu không → revert. Phần còn lại của team không bị ảnh hưởng. Không downtime, không migration.


Tiếp theo: AI team gặp GitHub

Bạn đã biết Paperclip chạy được với AI nào, cách chọn model theo vai trò, và cách mix models trong 1 team. Nhưng team AI của bạn không sống trong chân không — nó cần tích hợp vào quy trình phát triển phần mềm thực tế.

Trong bài tiếp theo, chúng tôi sẽ đi vào câu hỏi mà mọi engineering manager đều quan tâm: AI agents có tạo PR đúng branch không? Có pass CI không? Commit message có đọc hiểu được không? Đó là Paperclip + GitHub — cách AI team trở thành thành viên thực sự trong quy trình dev.

Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *

Website này sử dụng cookie để mang đến trải nghiệm duyệt web tốt hơn cho bạn. Bằng việc tiếp tục sử dụng website, bạn đồng ý với việc sử dụng cookie của chúng tôi.
This website uses cookies to give you a better browsing experience. By browsing this website, you agree to our use of cookies.
このウェブサイトでは、より快適なブラウジング体験を提供するためにCookieを使用しています。このウェブサSイトを閲覧することにより、お客様はCookieの使用に同意したことになります。