facebook-pixel

AI Crawler là gì? Bản đồ 14 nền tảng AI & 26 bot cần kiểm tra

Author: Võ Đăng Thi|16 min read|12 Tháng 4, 2026
Tóm tắt bài viết với:

ĐIỂM NHẤN CỐT LÕI (KEY TAKEAWAYS)

  • AI Crawler là các bot hoặc hệ thống tự động được các công ty AI sử dụng để truy cập, thu thập, truy xuất hoặc đọc dữ liệu trên website phục vụ AI Search hoặc huấn luyện mô hình.
  • FAST MARKETING phân biệt 3 nhóm bot chính: Bot truy hồi (Retrieval - ưu tiên Cho phép để tăng AI Visibility), Bot người dùng (User-triggered - ưu tiên Cho phép), và Bot huấn luyện (Training - do doanh nghiệp quyết định theo chính sách dữ liệu).
  • Bản đồ 14 nền tảng AI và 26 bot quan trọng: ChatGPT (OAI-SearchBot, GPTBot, ChatGPT-User), Google (Googlebot, Google-Extended), Claude (Claude-SearchBot, ClaudeBot), Perplexity (PerplexityBot), Copilot (bingbot)...
  • Audit AI Crawler không được dừng lại ở robots.txt: Bắt buộc phải kiểm tra cả CDN (Cloudflare AI Bot Blocking), WAF, Firewall, Server Log và khả năng Render nội dung JavaScript.
  • Cấu hình robots.txt chuẩn xác giúp website tối đa hóa khả năng xuất hiện trên các công cụ tìm kiếm AI mà không lo bị khai thác dữ liệu huấn luyện ngoài ý muốn.

Khi làm GEO (Generative Engine Optimization), một trong những câu hỏi đầu tiên FAST MARKETING kiểm tra không phải là “website đã có đủ content chưa?” mà là:

“Các hệ thống AI có thực sự được phép truy cập, đọc hiểu và sử dụng nội dung của website hay không?”

Đây là một vấn đề ngày càng quan trọng vì ChatGPT, Google AI, Claude, Perplexity, Microsoft Copilot và các AI assistant khác không sử dụng cùng một crawler, cùng một search index hay cùng một chính sách robots.txt.

Một website có thể được Google crawl bình thường nhưng lại chặn OAI-SearchBot. Một doanh nghiệp có thể chủ động chặn GPTBot để không cho OpenAI dùng nội dung cho huấn luyện mô hình, nhưng lại vô tình chặn luôn bot phục vụ ChatGPT Search. Hoặc tệ hơn, tệp robots.txt có thể hoàn toàn đúng nhưng Cloudflare, CDN hoặc WAF lại chặn request trước khi crawler đến được máy chủ web.

Đó là lý do FAST MARKETING xem AI crawler accessibility là một phần cốt lõi của nền tảng GEO Technical, không phải một hạng mục phụ.

Bản đồ 14 nền tảng AI và 26 AI Crawler cần kiểm tra trong GEO Technical - FAST MARKETING
Hình 1 - Kiến trúc kiểm soát truy cập AI Crawler từ tầng CDN, Firewall đến robots.txt và Semantic Action Layer

AI crawler là gì?

AI crawler là bot hoặc hệ thống tự động được các công ty AI sử dụng để truy cập, thu thập, truy xuất hoặc đọc nội dung trên web.

Tuy nhiên, thuật ngữ “AI crawler” thường bị hiểu quá chung chung. Trên thực tế, các bot AI được phát triển nhằm phục vụ những mục đích hoàn toàn khác biệt:

1. Truy xuất dữ liệu để trả lời người dùng theo thời gian thực
2. Đọc trực tiếp URL do người dùng cung cấp trong khung chat
3. Thu thập dữ liệu phục vụ huấn luyện (Training) model
4. Thực hiện các tác vụ tự động hóa dạng Agent

Vì vậy, quyết định “Cho phép hay chặn AI bot?” tuyệt đối không thể áp dụng cào bằng giống nhau cho tất cả user-agent.

FAST MARKETING chia AI bot thành 3 nhóm chính

01

1. Bot truy hồi (Retrieval)

Được sử dụng để tìm kiếm, trích xuất dữ liệu website phục vụ câu trả lời AI Search tức thời.

• OAI-SearchBot
• Claude-SearchBot
• PerplexityBot
• Googlebot / bingbot
• Applebot
Khuyến nghị: ƯU TIÊN CHO PHÉP
02

2. Bot theo yêu cầu (User)

Được kích hoạt khi người dùng dán link trực tiếp vào AI chat và yêu cầu tóm tắt hoặc phân tích.

• ChatGPT-User
• Claude-User
• Perplexity-User
• MistralAI-User
Khuyến nghị: ƯU TIÊN CHO PHÉP
03

3. Bot huấn luyện (Training)

Thu thập khối lượng lớn dữ liệu để đào tạo các thế hệ mô hình ngôn ngữ lớn (LLM) tương lai.

• GPTBot
• ClaudeBot
• meta-externalagent
• CCBot (Common Crawl)
Khuyến nghị: CLIENT TỰ QUYẾT ĐỊNH

Nguyên tắc cốt lõi: Nếu mục tiêu của doanh nghiệp là tăng AI Visibility và AI Share of Voice, nhóm bot truy hồi (Retrieval) và bot kích hoạt bởi người dùng (User) phải luôn được mở quyền truy cập.

Timeline AI Search 2023–2026: Những cột mốc thay đổi cách làm GEO

09/2023

Microsoft mở quyền kiểm soát nội dung trong Bing Chat

Microsoft cung cấp cơ chế nocachenoarchive giúp website kiểm soát việc hiển thị mà không cần chặn hoàn toàn crawler bằng robots.txt.

11/2023

Công bố nghiên cứu khoa học GEO đầu tiên trên thế giới

Princeton, IIT Delhi, Georgia Tech và Allen Institute chính thức công bố nghiên cứu Generative Engine Optimization, tạo tiền đề khoa học cho ngành GEO hiện đại.

03/2025

Nghiên cứu Tow Center chỉ ra thách thức về độ chính xác Citation

Tỷ lệ sai lệch trích dẫn của AI khẳng định tầm quan trọng của việc đo lường không chỉ Mention mà còn là Accuracy (Độ chính xác)AI Sentiment.

05/2025

Google công bố hướng dẫn chính thức về AI Search

Google khẳng định website không cần bộ yêu cầu SEO hoàn toàn mới cho AI Overviews. GEO được xây dựng trên nền tảng vững chắc của SEO, không thay thế SEO.

07/2025

Cloudflare chặn AI crawler theo mặc định cho khách hàng mới

Bước ngoặt kỹ thuật: Một website có thể mở robots.txt nhưng vẫn bị chặn bot AI ở tầng CDN / WAF. Kể từ đây, audit AI crawler bắt buộc phải kiểm tra cả tầng hạ tầng mạng.

09–11/2025

ChatGPT tiến vào kỷ nguyên Commerce & Shopping Research

Instant Checkout và Shopping Research biến AI từ người tổng hợp thông tin thành trợ lý tư vấn và giao dịch trực tiếp.

01/2026

Google công bố Universal Commerce Protocol cho Agent Action

Mở rộng Action Layer: Đặt ra yêu cầu website không chỉ machine-readable (máy đọc được) mà phải machine-actionable (máy thực hiện thao tác được).

02/2026

Bing ra mắt báo cáo AI Performance Report chính thức

Bing Webmaster Tools cung cấp dữ liệu đo lường trực tiếp từ công cụ tìm kiếm: Total Citations, Average Cited Pages, Grounding Queries.

05–07/2026

Agentic Booking & Định giá kinh tế cho Citation

Google I/O 2026 đẩy mạnh Agentic Information & Booking; Cloudflare chuyển trọng tâm sang định giá giá trị sử dụng citation thực tế.

3 xu hướng lớn rút ra cho chiến lược GEO

1. GEO đã được chính thức hóa

Có guideline chính thức từ các search engine, reporting riêng, user-agent chuyên biệt và giao thức commerce chuẩn hóa.

2. Chuyển từ "Được đọc" sang "Thực thi hành động"

Semantic HTML, form label, pricing structure, CTA rõ ràng để các AI Agent có thể hiểu giá, điền form và hoàn tất giao dịch.

3. Hạ tầng CDN/WAF là người gác cổng

Nội dung xuất sắc vẫn vô nghĩa nếu crawler bị chặn ở tầng CDN/Firewall. Kiểm tra hạ tầng là bước tiên quyết trong mọi dự án GEO.

Bản đồ 14 nền tảng AI và bot tương ứng

Nền tảng AI Bot / Nguồn chính cần quan tâm Mức ưu tiên
ChatGPT OAI-SearchBot, ChatGPT-User, GPTBot Rất cao
Google AI Overviews / AI Mode Googlebot Rất cao
Claude Claude-SearchBot, Claude-User, ClaudeBot Cao
Perplexity PerplexityBot, Perplexity-User Cao
Microsoft Copilot bingbot Cao
Gemini Notebook User-triggered retrieval Theo nhu cầu
Meta AI meta-externalagent Đáng theo dõi tại VN
Apple Intelligence / Siri Applebot Cho phép
Amazon Amazonbot Tùy ngành
DuckDuckGo AI DuckAssistBot Thấp
Le Chat (Mistral) MistralAI-User Thị trường EU
Grok (xAI) Chưa công bố rõ ràng Khó đo
Doubao (ByteDance) Bytespider Theo dõi
Common Crawl CCBot Ảnh hưởng mô hình mở

Phân tích chi tiết các hệ thống AI trọng điểm

1. ChatGPT (OpenAI)

OpenAI vận hành 3 user-agent riêng biệt mà bạn cần phân biệt rõ ràng:

  • OAI-SearchBot: Phục vụ trực tiếp cho tính năng ChatGPT Search. Nếu muốn website xuất hiện trong câu trả lời tìm kiếm của ChatGPT, bắt buộc phải Allow bot này.
  • ChatGPT-User: Kích hoạt khi người dùng dán link bài viết trực tiếp vào ChatGPT để yêu cầu tóm tắt. Khuyến nghị Allow.
  • GPTBot: Thu thập dữ liệu để huấn luyện các model AI tiếp theo. Doanh nghiệp có thể Disallow nếu muốn bảo vệ bản quyền dữ liệu mà không ảnh hưởng tới ChatGPT Search.

2. Google AI Overviews & AI Mode

Google không sử dụng một crawler riêng có tên "AI Overviews Bot". Google hoàn toàn sử dụng dữ liệu từ hệ thống thu thập tin Search truyền thống: Googlebot.

Lưu ý về Google-Extended: Đây là token kiểm soát việc sử dụng nội dung cho việc đào tạo các mô hình AI (như Gemini/Vertex AI). Chặn Google-Extended không làm website mất vị trí trong Google AI Overviews.

3. Anthropic Claude

Cấu trúc của Anthropic tương tự OpenAI:

  • Claude-SearchBot: Truy hồi tìm kiếm theo thời gian thực (Ưu tiên Allow).
  • Claude-User: Đọc URL người dùng gửi (Ưu tiên Allow).
  • ClaudeBot: Thu thập dữ liệu huấn luyện mô hình Claude (Tùy chính sách).

4. Perplexity

Gồm PerplexityBot (chạy ngầm thu thập chỉ mục) và Perplexity-User (truy cập khi người dùng kích hoạt tìm kiếm). Do Perplexity có cơ chế trích dẫn rất phong phú, việc duy trì mở 2 bot này là yếu tố sống còn để giữ thứ hạng trên Perplexity.

Bảng tổng hợp phân loại 26 AI Crawler

Nhóm chức năng Các User-Agent tiêu biểu Khuyến nghị FAST MARKETING
Truy hồi (Retrieval) OAI-SearchBot, Claude-SearchBot, Googlebot, bingbot, PerplexityBot, Applebot Ưu tiên CHO PHÉP (Allow) để tối đa hóa AI Visibility
Người dùng (User-Triggered) ChatGPT-User, Claude-User, Perplexity-User, MistralAI-User Ưu tiên CHO PHÉP để người dùng có thể gửi link cho AI đọc
Huấn luyện (Training) GPTBot, ClaudeBot, CCBot, meta-externalagent, Bytespider Doanh nghiệp tự quyết định theo chính sách sở hữu trí tuệ
Agent & Action Google-Agent, AI Shopping Bots Theo dõi sát và chuẩn bị sẵn sàng Action Layer

4 hiểu lầm tai hại khi audit AI Crawler

Hiểu lầm 1: “Chặn bot AI là bảo vệ toàn diện website”

Chặn bot huấn luyện là đúng, nhưng chặn luôn bot truy hồi sẽ tự tay gạch tên website khỏi toàn bộ kết quả tìm kiếm AI Search của khách hàng.

Hiểu lầm 2: “Chặn Google-Extended sẽ mất AI Overviews”

Sai hoàn toàn. Google-Extended chỉ dùng cho mục đích đào tạo mô hình riêng, không ảnh hưởng đến thuật toán sinh AI Overview của Googlebot.

Hiểu lầm 3: “Chỉ cần sửa file robots.txt là xong”

robots.txt chỉ là tầng ứng dụng. Nếu Cloudflare Bot Fight Mode hoặc WAF chặn request 403 ở tầng mạng, bot vẫn không bao giờ chạm tới website.

Hiểu lầm 4: “Có thể đo được 100% traffic từ AI bot”

Nhiều hệ thống như Grok hay các bot ẩn danh không công khai user-agent. Dữ liệu log chỉ phản ánh một phần các bot tuân thủ chuẩn Webmaster.

Checklist 5 bước Audit AI Crawler chuẩn FAST MARKETING

1

Kiểm tra robots.txt trực tiếp

Mở https://domain.com/robots.txt và rà soát từng dòng chỉ thị của OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot.

2

Kiểm tra cấu hình CDN & WAF

Vào bảng điều khiển Cloudflare / AWS CloudFront: kiểm tra xem tính năng AI Scrapers and Crawlers Block hoặc Bot Fight Mode có vô tình chặn bot hợp lệ không.

3

Rà soát Server Access Log

Trích xuất log máy chủ web (Nginx/Apache) để xác nhận các HTTP Status Code (200 OK hay 403 Forbidden) khi bot AI gửi request.

4

Kiểm tra khả năng Rendering nội dung

Đảm bảo crawler đọc được giá sản phẩm, bảng so sánh, FAQ và thông số kỹ thuật ngay trong Source HTML mà không bị phụ thuộc vào JavaScript nặng.

5

Phân quyền theo mục tiêu kinh doanh

Tách biệt rõ ràng chỉ thị cho Retrieval Bots (Allow) và Training Bots (Disallow nếu cần) thay vì dùng Disallow: / cho toàn bộ User-agent.

Cấu hình robots.txt mẫu: 3 kịch bản tương ứng 3 loại Client

Dưới đây là 3 kịch bản cấu hình được FAST MARKETING chuẩn hóa cho từng nhóm doanh nghiệp:

Kịch bản A: Tối đa hiển thị (Khuyến nghị mặc định)

Mặc định cho Thương mại / Dịch vụ

Cho phép tất cả bot AI truy cập. Phù hợp với phần lớn client thương mại, bán lẻ, dịch vụ B2B nơi mục tiêu cao nhất là được AI biết tới và nhắc tên càng nhiều càng tốt.

# Cho phép toàn bộ crawler AI - tối đa hoá hiển thị
User-agent: *
Allow: /

# Nêu tên tường minh để tránh bị quy tắc khác chặn nhầm
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: GPTBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: ClaudeBot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Googlebot
User-agent: bingbot
User-agent: Applebot
User-agent: Amazonbot
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: meta-externalagent
User-agent: CCBot
Allow: /

Sitemap: https://example.com/sitemap.xml

Kịch bản B: Hiển thị nhưng không cho huấn luyện

Dành cho Báo chí / Nội dung độc quyền

Vẫn xuất hiện đầy đủ trong câu trả lời AI Search, nhưng nội dung không bị dùng để huấn luyện mô hình. Đây là cấu hình cân bằng nhất và là đề xuất mặc định cho client báo chí, xuất bản, viện nghiên cứu, SaaS có tài liệu độc quyền.

# CHO PHÉP - nhóm truy hồi và người dùng: quyết định việc được nhắc trong câu trả lời
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Googlebot
User-agent: bingbot
User-agent: Applebot
User-agent: DuckAssistBot
User-agent: MistralAI-User
Allow: /

# CHẶN - nhóm huấn luyện mô hình
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: meta-externalagent
Disallow: /

User-agent: Amazonbot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

Sitemap: https://example.com/sitemap.xml

Kịch bản C: Cho phép có chọn lọc theo thư mục

Mở Marketing, Đóng Private & Cart

Mở các thư mục nội dung marketing, sản phẩm công khai; đồng thời bảo vệ chặt chẽ các thư mục tài khoản, nội dung trả phí (paywall), giỏ hàng và tham số query.

User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Allow: /blog/
Allow: /san-pham/
Allow: /ho-tro/
Allow: /ve-chung-toi/
Disallow: /tai-khoan/
Disallow: /premium/
Disallow: /gio-hang/
Disallow: /*?

Sitemap: https://example.com/sitemap.xml

Cấu hình thẻ Meta bổ sung cho Microsoft Copilot & Amazon

Ngoài robots.txt, bạn có thể kiểm soát chi tiết ở cấp độ từng trang (Page-level) bằng các thẻ meta trong phần <head>:

<!-- Đặt trong thẻ <head> của từng trang -->
<!-- Cho phép index và xếp hạng bình thường, nhưng KHÔNG dùng trong câu trả lời AI -->
<meta name="robots" content="noarchive">

<!-- Hoặc chỉ áp dụng riêng cho Bing / Microsoft Copilot -->
<meta name="bingbot" content="nocache">

<!-- Amazon: Chặn dùng huấn luyện ở cấp từng trang -->
<meta name="robots" content="noarchive">

Năm bước kiểm tra bắt buộc sau khi cấu hình

1

Mở trực tiếp robots.txt trên trình duyệt

Truy cập https://domain.com/robots.txt để xác nhận file đã cập nhật đúng cú pháp và không bị cache cũ.

2

Kiểm tra tầng CDN / WAF riêng biệt

Cloudflare chặn AI crawler mặc định từ 07/2025. Nếu robots.txt cho phép nhưng Cloudflare vẫn chặn thì vô nghĩa. Vào Cloudflare Dashboard → Security → Bots → kiểm tra AI Scrapers & Crawlers.

3

Test bằng User-Agent giả lập

Chạy lệnh terminal: curl -A "Mozilla/5.0 ...OAI-SearchBot/1.4..." https://domain.com/trang-quan-trong và kiểm tra xem mã HTML trả về có đầy đủ nội dung chính không.

4

Đợi và phân tích Server Log

Sau 4–6 tuần, lọc server access log theo user-agent AI để xác nhận bot thật sự đã vào cào dữ liệu. Không có bước này thì mọi số đo AI Visibility đều thiếu căn cứ.

5

Ghi biên bản kỹ thuật chính thức

Lưu lại quyết định cho phép / chặn từng bot cùng xác nhận của Client. Đây là quyết định mang tính chiến lược kinh doanh và sở hữu dữ liệu, cần có văn bản thống nhất rõ ràng.

Kết luận: AI Crawler là hạ tầng nền móng của GEO

Tối ưu hóa AI Crawler không phải là một thủ thuật "hack rank" tạm thời. Đây là nền tảng kỹ thuật tối thiểu để đảm bảo toàn bộ công sức xây dựng content, entity và uy tín thương hiệu được các mô hình AI tiếp nhận và đề xuất chính xác cho khách hàng.

Hãy nhớ chuỗi chuyển đổi giá trị trong GEO:

Accessibility (Crawler vào được) → Retrieval (Truy xuất) → Understanding (Hiểu đúng) → Authority → AI Visibility → Conversion

Cần Audit Technical GEO & Cấu Hình AI Crawler Chuyên Nghiệp?

Đội ngũ chuyên gia kỹ thuật FAST MARKETING sẽ trực tiếp rà soát toàn bộ hệ thống robots.txt, Cloudflare, CDN, WAF và xây dựng kiến trúc Semantic chuẩn mực giúp website của bạn sẵn sàng dẫn đầu kỷ nguyên AI Search.

Đo Điểm Sẵn Sàng GEO (AI Search)

Điểm:60/100
Có tệp dữ liệu sạch cho AI (llms.txt) & Schema Entity
+20đ
Nội dung cấu trúc Direct Answer & Data Gain (Google AI Overviews)
+25đ
Knowledge Graph & NAP đồng nhất (Trustpilot, G2, ScamAdviser)
+20đ
Mở cổng AI Crawlers (GPTBot, ClaudeBot) & Core Web Vitals xanh
+15đ
Theo dõi tần suất xuất hiện thương hiệu trên ChatGPT & Gemini
+20đ
Trung Bình - Cần Nâng Cấp GEO
Nhận Audit GEO →
Võ Đăng Thi

CEO & Founder @ Fast Marketing • Chuyên gia Chiến lược SEO & GEO

Chuyên gia hơn 6+ năm thực chiến trong lĩnh vực SEO, GEO (Generative Engine Optimization) & Entity Building. Tiên phong giải pháp tối ưu hóa hiện diện thương hiệu trên Google và các công cụ tìm kiếm AI (ChatGPT, Gemini, Perplexity) cho hơn 200+ doanh nghiệp.

BÀI LIÊN QUAN GEO

FAST MARKETING chính thức ra mắt GEO R&D Lab Việt Nam

FAST MARKETING chính thức giới thiệu GEO R&D Lab – bộ phận nghiên cứu và thử nghiệm chuyên sâu về Generative Engine Optimization (GEO), nghiên cứu AI Search, AI Crawler, Retrieval, Citation và tối ưu thương hiệu trên ChatGPT, Gemini, Perplexity, Claude và Copilot.

GEOVõ Đăng Thi15 min read17 Tháng 8, 2026
Tư Vấn Trực Tiếp 1:1Phản hồi ngay sau 1 - 3 phút
Võ Đăng Thi
Võ Đăng Thi
CEO & Founder

SEO • GEO • Entity AI

Văn Thân
Văn Thân
Co-Founder & Tech

Performance Ads • AI Tech