AI Crawler là gì? Bản đồ 14 nền tảng AI & 26 bot cần kiểm tra
ĐIỂM NHẤN CỐT LÕI (KEY TAKEAWAYS)
- ✓AI Crawler là các bot hoặc hệ thống tự động được các công ty AI sử dụng để truy cập, thu thập, truy xuất hoặc đọc dữ liệu trên website phục vụ AI Search hoặc huấn luyện mô hình.
- ✓FAST MARKETING phân biệt 3 nhóm bot chính: Bot truy hồi (Retrieval - ưu tiên Cho phép để tăng AI Visibility), Bot người dùng (User-triggered - ưu tiên Cho phép), và Bot huấn luyện (Training - do doanh nghiệp quyết định theo chính sách dữ liệu).
- ✓Bản đồ 14 nền tảng AI và 26 bot quan trọng: ChatGPT (OAI-SearchBot, GPTBot, ChatGPT-User), Google (Googlebot, Google-Extended), Claude (Claude-SearchBot, ClaudeBot), Perplexity (PerplexityBot), Copilot (bingbot)...
- ✓Audit AI Crawler không được dừng lại ở robots.txt: Bắt buộc phải kiểm tra cả CDN (Cloudflare AI Bot Blocking), WAF, Firewall, Server Log và khả năng Render nội dung JavaScript.
- ✓Cấu hình robots.txt chuẩn xác giúp website tối đa hóa khả năng xuất hiện trên các công cụ tìm kiếm AI mà không lo bị khai thác dữ liệu huấn luyện ngoài ý muốn.
Khi làm GEO (Generative Engine Optimization), một trong những câu hỏi đầu tiên FAST MARKETING kiểm tra không phải là “website đã có đủ content chưa?” mà là:
“Các hệ thống AI có thực sự được phép truy cập, đọc hiểu và sử dụng nội dung của website hay không?”
Đây là một vấn đề ngày càng quan trọng vì ChatGPT, Google AI, Claude, Perplexity, Microsoft Copilot và các AI assistant khác không sử dụng cùng một crawler, cùng một search index hay cùng một chính sách robots.txt.
Một website có thể được Google crawl bình thường nhưng lại chặn OAI-SearchBot. Một doanh nghiệp có thể chủ động chặn GPTBot để không cho OpenAI dùng nội dung cho huấn luyện mô hình, nhưng lại vô tình chặn luôn bot phục vụ ChatGPT Search. Hoặc tệ hơn, tệp robots.txt có thể hoàn toàn đúng nhưng Cloudflare, CDN hoặc WAF lại chặn request trước khi crawler đến được máy chủ web.
Đó là lý do FAST MARKETING xem AI crawler accessibility là một phần cốt lõi của nền tảng GEO Technical, không phải một hạng mục phụ.
AI crawler là gì?
AI crawler là bot hoặc hệ thống tự động được các công ty AI sử dụng để truy cập, thu thập, truy xuất hoặc đọc nội dung trên web.
Tuy nhiên, thuật ngữ “AI crawler” thường bị hiểu quá chung chung. Trên thực tế, các bot AI được phát triển nhằm phục vụ những mục đích hoàn toàn khác biệt:
Vì vậy, quyết định “Cho phép hay chặn AI bot?” tuyệt đối không thể áp dụng cào bằng giống nhau cho tất cả user-agent.
FAST MARKETING chia AI bot thành 3 nhóm chính
1. Bot truy hồi (Retrieval)
Được sử dụng để tìm kiếm, trích xuất dữ liệu website phục vụ câu trả lời AI Search tức thời.
2. Bot theo yêu cầu (User)
Được kích hoạt khi người dùng dán link trực tiếp vào AI chat và yêu cầu tóm tắt hoặc phân tích.
3. Bot huấn luyện (Training)
Thu thập khối lượng lớn dữ liệu để đào tạo các thế hệ mô hình ngôn ngữ lớn (LLM) tương lai.
Nguyên tắc cốt lõi: Nếu mục tiêu của doanh nghiệp là tăng AI Visibility và AI Share of Voice, nhóm bot truy hồi (Retrieval) và bot kích hoạt bởi người dùng (User) phải luôn được mở quyền truy cập.
Timeline AI Search 2023–2026: Những cột mốc thay đổi cách làm GEO
Microsoft mở quyền kiểm soát nội dung trong Bing Chat
Microsoft cung cấp cơ chế nocache và noarchive giúp website kiểm soát việc hiển thị mà không cần chặn hoàn toàn crawler bằng robots.txt.
Công bố nghiên cứu khoa học GEO đầu tiên trên thế giới
Princeton, IIT Delhi, Georgia Tech và Allen Institute chính thức công bố nghiên cứu Generative Engine Optimization, tạo tiền đề khoa học cho ngành GEO hiện đại.
Nghiên cứu Tow Center chỉ ra thách thức về độ chính xác Citation
Tỷ lệ sai lệch trích dẫn của AI khẳng định tầm quan trọng của việc đo lường không chỉ Mention mà còn là Accuracy (Độ chính xác) và AI Sentiment.
Google công bố hướng dẫn chính thức về AI Search
Google khẳng định website không cần bộ yêu cầu SEO hoàn toàn mới cho AI Overviews. GEO được xây dựng trên nền tảng vững chắc của SEO, không thay thế SEO.
Cloudflare chặn AI crawler theo mặc định cho khách hàng mới
Bước ngoặt kỹ thuật: Một website có thể mở robots.txt nhưng vẫn bị chặn bot AI ở tầng CDN / WAF. Kể từ đây, audit AI crawler bắt buộc phải kiểm tra cả tầng hạ tầng mạng.
ChatGPT tiến vào kỷ nguyên Commerce & Shopping Research
Instant Checkout và Shopping Research biến AI từ người tổng hợp thông tin thành trợ lý tư vấn và giao dịch trực tiếp.
Google công bố Universal Commerce Protocol cho Agent Action
Mở rộng Action Layer: Đặt ra yêu cầu website không chỉ machine-readable (máy đọc được) mà phải machine-actionable (máy thực hiện thao tác được).
Bing ra mắt báo cáo AI Performance Report chính thức
Bing Webmaster Tools cung cấp dữ liệu đo lường trực tiếp từ công cụ tìm kiếm: Total Citations, Average Cited Pages, Grounding Queries.
Agentic Booking & Định giá kinh tế cho Citation
Google I/O 2026 đẩy mạnh Agentic Information & Booking; Cloudflare chuyển trọng tâm sang định giá giá trị sử dụng citation thực tế.
3 xu hướng lớn rút ra cho chiến lược GEO
1. GEO đã được chính thức hóa
Có guideline chính thức từ các search engine, reporting riêng, user-agent chuyên biệt và giao thức commerce chuẩn hóa.
2. Chuyển từ "Được đọc" sang "Thực thi hành động"
Semantic HTML, form label, pricing structure, CTA rõ ràng để các AI Agent có thể hiểu giá, điền form và hoàn tất giao dịch.
3. Hạ tầng CDN/WAF là người gác cổng
Nội dung xuất sắc vẫn vô nghĩa nếu crawler bị chặn ở tầng CDN/Firewall. Kiểm tra hạ tầng là bước tiên quyết trong mọi dự án GEO.
Bản đồ 14 nền tảng AI và bot tương ứng
| Nền tảng AI | Bot / Nguồn chính cần quan tâm | Mức ưu tiên |
|---|---|---|
| ChatGPT | OAI-SearchBot, ChatGPT-User, GPTBot | Rất cao |
| Google AI Overviews / AI Mode | Googlebot | Rất cao |
| Claude | Claude-SearchBot, Claude-User, ClaudeBot | Cao |
| Perplexity | PerplexityBot, Perplexity-User | Cao |
| Microsoft Copilot | bingbot | Cao |
| Gemini Notebook | User-triggered retrieval | Theo nhu cầu |
| Meta AI | meta-externalagent | Đáng theo dõi tại VN |
| Apple Intelligence / Siri | Applebot | Cho phép |
| Amazon | Amazonbot | Tùy ngành |
| DuckDuckGo AI | DuckAssistBot | Thấp |
| Le Chat (Mistral) | MistralAI-User | Thị trường EU |
| Grok (xAI) | Chưa công bố rõ ràng | Khó đo |
| Doubao (ByteDance) | Bytespider | Theo dõi |
| Common Crawl | CCBot | Ảnh hưởng mô hình mở |
Phân tích chi tiết các hệ thống AI trọng điểm
1. ChatGPT (OpenAI)
OpenAI vận hành 3 user-agent riêng biệt mà bạn cần phân biệt rõ ràng:
OAI-SearchBot: Phục vụ trực tiếp cho tính năng ChatGPT Search. Nếu muốn website xuất hiện trong câu trả lời tìm kiếm của ChatGPT, bắt buộc phải Allow bot này.ChatGPT-User: Kích hoạt khi người dùng dán link bài viết trực tiếp vào ChatGPT để yêu cầu tóm tắt. Khuyến nghị Allow.GPTBot: Thu thập dữ liệu để huấn luyện các model AI tiếp theo. Doanh nghiệp có thể Disallow nếu muốn bảo vệ bản quyền dữ liệu mà không ảnh hưởng tới ChatGPT Search.
2. Google AI Overviews & AI Mode
Google không sử dụng một crawler riêng có tên "AI Overviews Bot". Google hoàn toàn sử dụng dữ liệu từ hệ thống thu thập tin Search truyền thống: Googlebot.
Lưu ý về Google-Extended: Đây là token kiểm soát việc sử dụng nội dung cho việc đào tạo các mô hình AI (như Gemini/Vertex AI). Chặn Google-Extended không làm website mất vị trí trong Google AI Overviews.
3. Anthropic Claude
Cấu trúc của Anthropic tương tự OpenAI:
Claude-SearchBot: Truy hồi tìm kiếm theo thời gian thực (Ưu tiên Allow).Claude-User: Đọc URL người dùng gửi (Ưu tiên Allow).ClaudeBot: Thu thập dữ liệu huấn luyện mô hình Claude (Tùy chính sách).
4. Perplexity
Gồm PerplexityBot (chạy ngầm thu thập chỉ mục) và Perplexity-User (truy cập khi người dùng kích hoạt tìm kiếm). Do Perplexity có cơ chế trích dẫn rất phong phú, việc duy trì mở 2 bot này là yếu tố sống còn để giữ thứ hạng trên Perplexity.
Bảng tổng hợp phân loại 26 AI Crawler
| Nhóm chức năng | Các User-Agent tiêu biểu | Khuyến nghị FAST MARKETING |
|---|---|---|
| Truy hồi (Retrieval) | OAI-SearchBot, Claude-SearchBot, Googlebot, bingbot, PerplexityBot, Applebot | Ưu tiên CHO PHÉP (Allow) để tối đa hóa AI Visibility |
| Người dùng (User-Triggered) | ChatGPT-User, Claude-User, Perplexity-User, MistralAI-User | Ưu tiên CHO PHÉP để người dùng có thể gửi link cho AI đọc |
| Huấn luyện (Training) | GPTBot, ClaudeBot, CCBot, meta-externalagent, Bytespider | Doanh nghiệp tự quyết định theo chính sách sở hữu trí tuệ |
| Agent & Action | Google-Agent, AI Shopping Bots | Theo dõi sát và chuẩn bị sẵn sàng Action Layer |
4 hiểu lầm tai hại khi audit AI Crawler
Hiểu lầm 1: “Chặn bot AI là bảo vệ toàn diện website”
Chặn bot huấn luyện là đúng, nhưng chặn luôn bot truy hồi sẽ tự tay gạch tên website khỏi toàn bộ kết quả tìm kiếm AI Search của khách hàng.
Hiểu lầm 2: “Chặn Google-Extended sẽ mất AI Overviews”
Sai hoàn toàn. Google-Extended chỉ dùng cho mục đích đào tạo mô hình riêng, không ảnh hưởng đến thuật toán sinh AI Overview của Googlebot.
Hiểu lầm 3: “Chỉ cần sửa file robots.txt là xong”
robots.txt chỉ là tầng ứng dụng. Nếu Cloudflare Bot Fight Mode hoặc WAF chặn request 403 ở tầng mạng, bot vẫn không bao giờ chạm tới website.
Hiểu lầm 4: “Có thể đo được 100% traffic từ AI bot”
Nhiều hệ thống như Grok hay các bot ẩn danh không công khai user-agent. Dữ liệu log chỉ phản ánh một phần các bot tuân thủ chuẩn Webmaster.
Checklist 5 bước Audit AI Crawler chuẩn FAST MARKETING
Kiểm tra robots.txt trực tiếp
Mở https://domain.com/robots.txt và rà soát từng dòng chỉ thị của OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot.
Kiểm tra cấu hình CDN & WAF
Vào bảng điều khiển Cloudflare / AWS CloudFront: kiểm tra xem tính năng AI Scrapers and Crawlers Block hoặc Bot Fight Mode có vô tình chặn bot hợp lệ không.
Rà soát Server Access Log
Trích xuất log máy chủ web (Nginx/Apache) để xác nhận các HTTP Status Code (200 OK hay 403 Forbidden) khi bot AI gửi request.
Kiểm tra khả năng Rendering nội dung
Đảm bảo crawler đọc được giá sản phẩm, bảng so sánh, FAQ và thông số kỹ thuật ngay trong Source HTML mà không bị phụ thuộc vào JavaScript nặng.
Phân quyền theo mục tiêu kinh doanh
Tách biệt rõ ràng chỉ thị cho Retrieval Bots (Allow) và Training Bots (Disallow nếu cần) thay vì dùng Disallow: / cho toàn bộ User-agent.
Cấu hình robots.txt mẫu: 3 kịch bản tương ứng 3 loại Client
Dưới đây là 3 kịch bản cấu hình được FAST MARKETING chuẩn hóa cho từng nhóm doanh nghiệp:
Kịch bản A: Tối đa hiển thị (Khuyến nghị mặc định)
Mặc định cho Thương mại / Dịch vụCho phép tất cả bot AI truy cập. Phù hợp với phần lớn client thương mại, bán lẻ, dịch vụ B2B nơi mục tiêu cao nhất là được AI biết tới và nhắc tên càng nhiều càng tốt.
# Cho phép toàn bộ crawler AI - tối đa hoá hiển thị
User-agent: *
Allow: /
# Nêu tên tường minh để tránh bị quy tắc khác chặn nhầm
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: GPTBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: ClaudeBot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Googlebot
User-agent: bingbot
User-agent: Applebot
User-agent: Amazonbot
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: meta-externalagent
User-agent: CCBot
Allow: /
Sitemap: https://example.com/sitemap.xml
Kịch bản B: Hiển thị nhưng không cho huấn luyện
Dành cho Báo chí / Nội dung độc quyềnVẫn xuất hiện đầy đủ trong câu trả lời AI Search, nhưng nội dung không bị dùng để huấn luyện mô hình. Đây là cấu hình cân bằng nhất và là đề xuất mặc định cho client báo chí, xuất bản, viện nghiên cứu, SaaS có tài liệu độc quyền.
# CHO PHÉP - nhóm truy hồi và người dùng: quyết định việc được nhắc trong câu trả lời
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Googlebot
User-agent: bingbot
User-agent: Applebot
User-agent: DuckAssistBot
User-agent: MistralAI-User
Allow: /
# CHẶN - nhóm huấn luyện mô hình
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: meta-externalagent
Disallow: /
User-agent: Amazonbot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
Sitemap: https://example.com/sitemap.xml
Kịch bản C: Cho phép có chọn lọc theo thư mục
Mở Marketing, Đóng Private & CartMở các thư mục nội dung marketing, sản phẩm công khai; đồng thời bảo vệ chặt chẽ các thư mục tài khoản, nội dung trả phí (paywall), giỏ hàng và tham số query.
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Allow: /blog/
Allow: /san-pham/
Allow: /ho-tro/
Allow: /ve-chung-toi/
Disallow: /tai-khoan/
Disallow: /premium/
Disallow: /gio-hang/
Disallow: /*?
Sitemap: https://example.com/sitemap.xml
Cấu hình thẻ Meta bổ sung cho Microsoft Copilot & Amazon
Ngoài robots.txt, bạn có thể kiểm soát chi tiết ở cấp độ từng trang (Page-level) bằng các thẻ meta trong phần <head>:
<!-- Đặt trong thẻ <head> của từng trang -->
<!-- Cho phép index và xếp hạng bình thường, nhưng KHÔNG dùng trong câu trả lời AI -->
<meta name="robots" content="noarchive">
<!-- Hoặc chỉ áp dụng riêng cho Bing / Microsoft Copilot -->
<meta name="bingbot" content="nocache">
<!-- Amazon: Chặn dùng huấn luyện ở cấp từng trang -->
<meta name="robots" content="noarchive">
Năm bước kiểm tra bắt buộc sau khi cấu hình
Mở trực tiếp robots.txt trên trình duyệt
Truy cập https://domain.com/robots.txt để xác nhận file đã cập nhật đúng cú pháp và không bị cache cũ.
Kiểm tra tầng CDN / WAF riêng biệt
Cloudflare chặn AI crawler mặc định từ 07/2025. Nếu robots.txt cho phép nhưng Cloudflare vẫn chặn thì vô nghĩa. Vào Cloudflare Dashboard → Security → Bots → kiểm tra AI Scrapers & Crawlers.
Test bằng User-Agent giả lập
Chạy lệnh terminal: curl -A "Mozilla/5.0 ...OAI-SearchBot/1.4..." https://domain.com/trang-quan-trong và kiểm tra xem mã HTML trả về có đầy đủ nội dung chính không.
Đợi và phân tích Server Log
Sau 4–6 tuần, lọc server access log theo user-agent AI để xác nhận bot thật sự đã vào cào dữ liệu. Không có bước này thì mọi số đo AI Visibility đều thiếu căn cứ.
Ghi biên bản kỹ thuật chính thức
Lưu lại quyết định cho phép / chặn từng bot cùng xác nhận của Client. Đây là quyết định mang tính chiến lược kinh doanh và sở hữu dữ liệu, cần có văn bản thống nhất rõ ràng.
Kết luận: AI Crawler là hạ tầng nền móng của GEO
Tối ưu hóa AI Crawler không phải là một thủ thuật "hack rank" tạm thời. Đây là nền tảng kỹ thuật tối thiểu để đảm bảo toàn bộ công sức xây dựng content, entity và uy tín thương hiệu được các mô hình AI tiếp nhận và đề xuất chính xác cho khách hàng.
Hãy nhớ chuỗi chuyển đổi giá trị trong GEO:
Cần Audit Technical GEO & Cấu Hình AI Crawler Chuyên Nghiệp?
Đội ngũ chuyên gia kỹ thuật FAST MARKETING sẽ trực tiếp rà soát toàn bộ hệ thống robots.txt, Cloudflare, CDN, WAF và xây dựng kiến trúc Semantic chuẩn mực giúp website của bạn sẵn sàng dẫn đầu kỷ nguyên AI Search.
Hỏi Sâu AI Về Bài Này
Đo Điểm Sẵn Sàng GEO (AI Search)
CEO & Founder @ Fast Marketing • Chuyên gia Chiến lược SEO & GEO
Chuyên gia hơn 6+ năm thực chiến trong lĩnh vực SEO, GEO (Generative Engine Optimization) & Entity Building. Tiên phong giải pháp tối ưu hóa hiện diện thương hiệu trên Google và các công cụ tìm kiếm AI (ChatGPT, Gemini, Perplexity) cho hơn 200+ doanh nghiệp.
BÀI LIÊN QUAN GEO
FAST MARKETING chính thức ra mắt GEO R&D Lab Việt Nam
FAST MARKETING chính thức giới thiệu GEO R&D Lab – bộ phận nghiên cứu và thử nghiệm chuyên sâu về Generative Engine Optimization (GEO), nghiên cứu AI Search, AI Crawler, Retrieval, Citation và tối ưu thương hiệu trên ChatGPT, Gemini, Perplexity, Claude và Copilot.
Timeline GEO 2023–2026: 12 thay đổi lớn của AI Search
FAST MARKETING tổng hợp timeline GEO 2023–2026: Google AI Search, Bing GEO, AI crawler, agentic commerce, zero-click và những thay đổi trực tiếp tới SEO, GEO và ecommerce.
Yếu tố xếp hạng GEO cấp nội dung: FAST MARKETING phân tích nghiên cứu
FAST MARKETING phân tích nghiên cứu GEO và C-SEO Bench để xác định các yếu tố content nên ưu tiên: citation, quote, số liệu, độ rõ ràng, authoritative writing và keyword stuffing.
SEO, AEO, GEO, AIO là gì? Phân biệt đúng để đo đúng
Phân biệt SEO, AEO, GEO, AIO và LLMO: mục tiêu, bề mặt hiển thị, KPI và cách đo. FAST MARKETING giải thích vì sao nên dùng GEO làm thuật ngữ chính thức.