Blog · SEO kỹ thuật

Google không index trang của bạn: 6 nguyên nhân và cách sửa

Người ngồi bên máy tính xách tay, tay cầm bút bên tờ giấy ghi danh sách kiểm tra, minh họa việc rà soát từng nguyên nhân khiến trang chưa được lập chỉ mục

Bài viết đã đăng ba tuần, gõ nguyên tiêu đề lên Google vẫn không thấy đâu. Đây là tình huống gặp nhiều nhất khi chúng tôi nhận audit website SME, và gần như lần nào nguyên nhân cũng nằm sẵn trong báo cáo Lập chỉ mục trang của Search Console - chỉ là chủ website chưa biết đọc dòng trạng thái đó nói gì. Bài này giải mã sáu nguyên nhân phổ biến nhất và cách xử lý từng loại.

Tóm tắt nhanh

Không được lập chỉ mục không phải một lỗi duy nhất mà là sáu nhóm nguyên nhân khác hẳn nhau: trang quá mới nên Google chưa ghé, Google đã đọc nhưng đánh giá chưa đáng đưa vào chỉ mục, trang bị gộp vì trùng lặp hoặc canonical trỏ nơi khác, bị chặn nhầm bằng noindex hoặc robots.txt, trang mồ côi không có liên kết nội bộ nào trỏ tới, và lỗi kỹ thuật kiểu soft 404 hay chuyển hướng. Mỗi nhóm có cách sửa riêng, và sửa sai nhóm thì trang nằm đó mãi. Bước đầu tiên luôn là mở Search Console, dán URL vào công cụ Kiểm tra URL và đọc đúng tên trạng thái trước khi đụng vào bất cứ thứ gì.

Trước hết: phân biệt thu thập dữ liệu và lập chỉ mục

Hai việc này thường bị gộp làm một, và đó là lý do nhiều người sửa nhầm chỗ. Thu thập dữ liệu là Googlebot tải trang về đọc. Lập chỉ mục là Google quyết định lưu trang đó vào kho để có thể đem ra xếp hạng. Một trang có thể được thu thập mà không được lập chỉ mục, và ngược lại một trang bị chặn thu thập vẫn có thể xuất hiện trong kết quả tìm kiếm nếu website khác trỏ link tới.

Chính vì thế hai trạng thái nghe na ná nhau trong Search Console lại có ý nghĩa trái ngược. Đã phát hiện - hiện chưa được lập chỉ mục nghĩa là Google biết URL tồn tại nhưng chưa ghé lần nào, thường liên quan tới tốc độ máy chủ và mức độ ưu tiên thu thập. Còn Đã thu thập dữ liệu - hiện chưa được lập chỉ mục nghĩa là Google đã đọc xong nội dung rồi và chọn không đưa vào chỉ mục, tức là vấn đề nằm ở chất lượng hoặc mức độ khác biệt của nội dung. Nhìn nhầm một chữ là đi sai hướng cả tháng.

Trạng thái trong Search ConsoleThực chất đang xảy ra gìViệc cần làm
Đã phát hiện - hiện chưa được lập chỉ mụcGoogle biết URL nhưng chưa thu thậpTăng tốc website, thêm liên kết nội bộ trỏ tới, chờ thêm
Đã thu thập dữ liệu - hiện chưa được lập chỉ mụcĐã đọc nội dung, chưa chọn lưu vào chỉ mụcViết sâu hơn, bổ sung góc riêng, gộp bài trùng chủ đề
Trang trùng lặp, người dùng chưa chọn trang chính tắcGoogle gộp trang này với một bản gần giốngKhai canonical rõ ràng hoặc viết lại cho khác biệt
Bị loại trừ bởi thẻ noindexTrang tự khai không muốn được indexGỡ thẻ noindex nếu đây là trang muốn lên Google
Đã lập chỉ mục, dù bị robots.txt chặnBị chặn đọc nhưng vẫn lọt vào chỉ mục qua liên kết ngoàiBỏ chặn trong robots.txt rồi mới gắn noindex
Lỗi mềm 404Trang trả về mã 200 nhưng nội dung như trang trốngBổ sung nội dung thật hoặc trả đúng mã 404/410

Tên trạng thái lấy theo giao diện tiếng Việt của báo cáo Lập chỉ mục trang. Bản tiếng Anh tương ứng là Discovered - currently not indexed, Crawled - currently not indexed, Duplicate without user-selected canonical, Excluded by noindex tag, Indexed though blocked by robots.txt, Soft 404.

Nguyên nhân 1: trang còn quá mới, Google chưa kịp ghé

Đây là trường hợp lành tính nhất và cũng hay bị hoảng oan nhất. Với một website mới hoặc ít backlink, Google phân bổ hạn mức thu thập rất dè dặt, nên một bài mới đăng có thể nằm ở trạng thái Đã phát hiện vài tuần. Không có mốc thời gian cam kết nào từ Google.

Điều đáng lưu ý: một trong những lý do khiến Google trì hoãn thu thập là máy chủ chậm. Google chủ động giảm tốc độ thu thập trên website phản hồi chậm để tránh làm quá tải máy chủ, nghĩa là site càng ì ạch thì càng ít trang được ghé thăm và lập chỉ mục. Nếu website của bạn có hàng loạt URL kẹt ở trạng thái Đã phát hiện, hãy kiểm tra thời gian phản hồi máy chủ trước khi nghĩ tới nội dung; thứ tự ưu tiên xử lý đã được bàn kỹ trong bài tốc độ website và Core Web Vitals: sửa gì trước.

Việc cần làm rất gọn: bảo đảm URL nằm trong sitemap.xml, có ít nhất hai ba liên kết nội bộ từ trang đã được index trỏ tới, rồi để yên. Bấm yêu cầu lập chỉ mục một lần là đủ - công cụ này chỉ xếp URL vào hàng đợi và có hạn mức theo ngày, bấm mười lần không đẩy nhanh được thứ tự.

Người đàn ông ôm đầu nhìn màn hình máy tính xách tay với vẻ bế tắc, minh họa cảm giác khi bài viết đã đăng lâu mà vẫn chưa được Google lập chỉ mục

Trạng thái "Đã thu thập dữ liệu - hiện chưa được lập chỉ mục" là dòng chữ gây ức chế nhất trong Search Console. Ảnh tư liệu (CC0).

Nguyên nhân 2: Google đọc rồi nhưng thấy chưa đáng index

Khi trạng thái là Đã thu thập dữ liệu - hiện chưa được lập chỉ mục, Googlebot đã tải trang, đã đọc nội dung, và hệ thống của Google kết luận trang chưa mang lại đủ giá trị để chiếm chỗ trong chỉ mục. Đây gần như luôn là vấn đề chất lượng chứ không phải kỹ thuật.

Dạng nội dung dính trạng thái này nhiều nhất là thứ mà giới SEO gọi là nội dung hàng chợ: bài viết lặp lại đúng những gì hàng trăm trang khác đã nói về cùng chủ đề, không thêm dữ liệu riêng, không thêm góc nhìn, không thêm ví dụ cụ thể. Trên website doanh nghiệp Việt, ba nhóm hay dính nhất là bài viết chuẩn SEO viết cho có, trang danh mục sản phẩm chỉ có tên và giá, và các trang địa phương nhân bản hàng loạt kiểu dịch vụ tại quận 1, dịch vụ tại quận 2 với nội dung y hệt nhau chỉ đổi tên quận.

Cách sửa không phải là viết dài hơn mà là viết khác đi: thêm số liệu bạn tự đo được, thêm ảnh chụp thật từ công việc của mình, thêm câu trả lời cho câu hỏi mà đối thủ né. Nếu ba bài đang cùng nói một chủ đề mà không bài nào được index, phương án tốt nhất thường là gộp cả ba thành một bài đủ sâu rồi chuyển hướng hai URL cũ về bài mới.

Nguyên nhân 3: trùng lặp và canonical trỏ nhầm chỗ

Khi Google thấy nhiều URL có nội dung gần như giống nhau, nó chọn một bản làm đại diện và bỏ qua phần còn lại. Nếu bạn không tự khai bản nào là chính, Google tự chọn, và báo cáo sẽ hiện Trang trùng lặp, người dùng chưa chọn trang chính tắc. Trường hợp trang bị loại vì thẻ canonical trỏ sang URL khác thì hiện Trang thay thế có thẻ chính tắc phù hợp - trạng thái này thường là bình thường và không cần sửa.

Các nguồn sinh URL trùng phổ biến trên website SME Việt Nam: một sản phẩm truy cập được qua nhiều đường dẫn danh mục khác nhau, tham số lọc và sắp xếp tạo ra vô số biến thể URL, bản có và không có dấu gạch chéo cuối, bản http và https, bản có tham số UTM từ chiến dịch quảng cáo. Chuyện gắn UTM sinh URL trùng đặc biệt hay gặp khi chạy quảng cáo, chúng tôi có nói kỹ hơn trong bài UTM tracking cho SME: biết đơn đến từ đâu.

Cách sửa: mỗi trang khai một thẻ canonical trỏ về chính URL chuẩn của nó, thống nhất một dạng URL duy nhất trong toàn site, và bảo đảm sitemap chỉ liệt kê URL chuẩn. Đừng dùng canonical để trỏ hai trang thật sự khác nội dung về nhau - Google có quyền bỏ qua khai báo đó nếu thấy vô lý.

Nguyên nhân 4: chặn nhầm bằng noindex hoặc robots.txt

Đây là nhóm gây thiệt hại nhanh nhất vì thường xảy ra sau một lần đổi giao diện hoặc chuyển máy chủ. Kịch bản kinh điển: website được dựng trên bản thử nghiệm có gắn noindex toàn site để tránh lộ, tới lúc lên bản chính thì quên gỡ. Cả website biến mất khỏi Google mà không ai hiểu vì sao.

Cạm bẫy thứ hai tinh vi hơn nhiều, và tài liệu của Google nói thẳng: để thẻ noindex có tác dụng, trang không được bị robots.txt chặn. Lý do rất đơn giản - nếu robots.txt chặn, Googlebot không bao giờ tải được trang, nên không bao giờ đọc thấy thẻ noindex, và trang vẫn có thể xuất hiện trong kết quả tìm kiếm khi có website khác trỏ link tới. Đó chính là trạng thái Đã lập chỉ mục, dù bị robots.txt chặn. Nhiều người thấy trạng thái này lại đi siết robots.txt chặt hơn, tức là làm ngược hoàn toàn.

Chặn đúng cách theo từng mục tiêu
  1. Muốn trang không xuất hiện trên Google: cho phép thu thập trong robots.txt, gắn thẻ meta noindex trên trang đó.
  2. Muốn giảm tải máy chủ, không cần giấu nội dung: chặn thư mục nặng trong robots.txt là đủ.
  3. Muốn giấu hẳn nội dung nội bộ: đặt sau lớp đăng nhập, đừng trông cậy vào robots.txt.
  4. Tuyệt đối không dùng đồng thời robots.txt chặn và noindex cho cùng một URL.

Google cũng nói rõ trong tài liệu rằng robots.txt chủ yếu để tránh làm quá tải website bằng các yêu cầu, chứ không phải cơ chế giữ một trang khỏi kết quả tìm kiếm. Đây là điểm bị hiểu sai nhiều nhất trong toàn bộ chủ đề lập chỉ mục.

Nguyên nhân 5: trang mồ côi, không ai trỏ tới

Google phát hiện nội dung mới chủ yếu bằng cách lần theo liên kết. Một trang chỉ nằm trong sitemap mà không có bất kỳ liên kết nội bộ nào trỏ tới sẽ nhận tín hiệu rất yếu: sitemap nói với Google rằng trang tồn tại, nhưng không nói rằng trang đó quan trọng. Kết quả thường là kẹt ở Đã phát hiện rất lâu, hoặc được index rồi tụt hạng dần.

Nhóm hay bị mồ côi nhất: trang đích dựng riêng cho một chiến dịch quảng cáo, bài viết cũ bị đẩy khỏi trang danh mục khi có bài mới hơn, và các trang dịch vụ phụ chỉ được nhắc trong menu thả xuống. Cách kiểm tra miễn phí là đối chiếu danh sách URL trong sitemap.xml với báo cáo Liên kết nội bộ trong Search Console: URL có trong sitemap nhưng vắng mặt trong báo cáo liên kết chính là ứng viên mồ côi. Mô hình nối lại toàn site theo ba tầng đã được mô tả chi tiết trong bài liên kết nội bộ cho website nhỏ: cấu trúc 3 tầng dễ làm.

Nguyên nhân 6: lỗi kỹ thuật khiến trang tự loại mình

Nhóm cuối gồm những trường hợp trang trả về tín hiệu mâu thuẫn với chính nó:

  • Lỗi mềm 404. Trang trả mã thành công 200 nhưng nội dung thực chất là trang trống, trang thông báo hết hàng, hoặc trang báo không tìm thấy kết quả. Google coi đây là trang không có giá trị. Cách sửa: hoặc bổ sung nội dung thật, hoặc trả đúng mã 404 hay 410 nếu trang thực sự không còn.
  • Trang có lệnh chuyển hướng. URL cũ được chuyển hướng nên bản thân nó không được index, đích đến mới là bản được lưu. Bình thường, trừ khi bạn vô tình chuyển hướng nhầm trang đang muốn giữ.
  • Nội dung chỉ hiện ra sau khi chạy JavaScript. Nếu HTML gốc gần như trống và toàn bộ chữ được nạp bằng JavaScript, việc lập chỉ mục phụ thuộc vào giai đoạn kết xuất và có thể chậm hoặc lỗi. Kiểm tra bằng nút Kiểm tra URL trực tiếp trong Search Console rồi xem tab HTML đã kết xuất.
  • Máy chủ trả lỗi lúc Googlebot ghé. Lỗi 5xx ngắt quãng không ảnh hưởng người dùng thật nhưng đủ để Google hoãn thu thập. Xem báo cáo Số liệu thống kê thu thập dữ liệu để bắt các đợt lỗi này.
Người đàn ông ghi chép vào sổ tay bên cạnh máy tính xách tay đang hiển thị biểu đồ, minh họa thói quen theo dõi báo cáo lập chỉ mục hằng tuần

Ghi lại số trang được index mỗi tuần giúp phát hiện sự cố sớm hơn nhiều so với chờ tới lúc mất traffic. Ảnh tư liệu (CC0).

Quy trình 7 bước tự kiểm tra khi một trang không lên Google

Làm tuần tự, đừng nhảy bước
  1. Dán URL vào công cụ Kiểm tra URL trong Search Console, đọc chính xác tên trạng thái đang hiện.
  2. Nếu là Bị loại trừ bởi thẻ noindex hoặc liên quan robots.txt, sửa phần chặn trước, mọi thứ khác tính sau.
  3. Kiểm tra thẻ canonical của trang có trỏ về chính nó không, và URL đó có nằm trong sitemap.xml không.
  4. Đếm số liên kết nội bộ trỏ tới trang; dưới hai thì bổ sung từ trang trụ cột cùng chủ đề.
  5. Xem tab HTML đã kết xuất để chắc nội dung chính có trong trang mà Google nhìn thấy.
  6. Nếu trạng thái là Đã thu thập dữ liệu - hiện chưa được lập chỉ mục, dừng việc kỹ thuật lại và viết lại nội dung cho khác biệt.
  7. Sửa xong mới bấm Yêu cầu lập chỉ mục một lần, ghi ngày lại, kiểm tra sau 10-14 ngày.

Một lưu ý về phạm vi: được lập chỉ mục chỉ là điều kiện cần. Trang vào chỉ mục rồi vẫn có thể không có lượt hiển thị nào nếu không ai tìm cụm từ đó, hoặc nếu câu trả lời đã bị AI Overviews chiếm chỗ ngay trên đầu trang kết quả. Cách theo dõi số hiển thị và lượt bấm hằng tuần nằm trong bài đọc Google Search Console: 4 báo cáo cần xem hằng tuần. Muốn soát nhanh toàn bộ tín hiệu kỹ thuật và GEO của một trang, có thể chạy công cụ audit SEO và GEO miễn phí của Chạm AI.

Câu hỏi thường gặp

Bao lâu thì Google index một trang mới?

Không có mốc cố định. Trang mới trên website đã có uy tín và được liên kết nội bộ tốt thường được lập chỉ mục trong vài ngày; website mới hoặc ít liên kết trỏ tới có thể mất vài tuần. Trong Search Console, trạng thái Đã phát hiện - hiện chưa được lập chỉ mục nghĩa là Google biết URL tồn tại nhưng chưa ghé, còn Đã thu thập dữ liệu - hiện chưa được lập chỉ mục nghĩa là Google đã đọc nội dung nhưng chưa chọn đưa vào chỉ mục. Nếu quá bốn tuần vẫn chưa index, hãy xử lý theo nguyên nhân thay vì bấm yêu cầu lập chỉ mục nhiều lần.

Chặn trang bằng robots.txt có gỡ được trang khỏi Google không?

Không. Tài liệu của Google nói rõ robots.txt dùng để tránh làm quá tải máy chủ, không phải cơ chế giữ một trang khỏi kết quả tìm kiếm. Tệ hơn, nếu trang vừa bị chặn trong robots.txt vừa gắn thẻ noindex thì Google không bao giờ đọc được thẻ noindex đó, nên trang vẫn có thể xuất hiện khi có website khác trỏ link tới. Muốn gỡ trang khỏi Google, phải để Googlebot thu thập được trang và gắn noindex, hoặc đặt trang sau lớp đăng nhập.

Bấm yêu cầu lập chỉ mục nhiều lần có giúp trang được index nhanh hơn không?

Không. Công cụ kiểm tra URL trong Search Console chỉ đưa URL vào hàng đợi thu thập và có hạn mức theo ngày; bấm lại nhiều lần cho cùng một URL không đẩy nhanh thứ tự. Nếu trang bị đánh giá là mỏng, trùng lặp hoặc không có liên kết nội bộ trỏ tới, gửi lại bao nhiêu lần cũng vô ích. Cách hiệu quả hơn là sửa đúng nguyên nhân rồi mới gửi lại một lần.

Nguồn tham khảo: tài liệu Google Search Central về chặn lập chỉ mục bằng noindex và về robots.txt; trang trợ giúp Search Console về báo cáo Lập chỉ mục trang; các phân tích thực hành về trạng thái Crawled và Discovered currently not indexed của Search Engine Journal và Onely (2026).

Website của anh chị có bao nhiêu trang chưa được lập chỉ mục?

Xem dịch vụ SEO kỹ thuật