Trình tạo Sitemap
Trình tạo sitemap.xml
Nhập danh sách URL, đặt changefreq, priority và lastmod toàn cục, tạo XML sitemap tuân thủ chuẩn sitemap.org chỉ với một cú nhấp.
Tạo trực tuyến tệp Sitemap XML sơ đồ trang web tuân thủ tiêu chuẩn giao thức mở sitemap.org 0.9, hỗ trợ cấu hình đầy đủ bảy tần suất cập nhật changefreq, độ ưu tiên tương đối priority 0.0-1.0, bộ chọn ngày lastmod, thoát thực thể XML tự động, phát hiện URL không hợp lệ theo thời gian thực, xem trước XML có cấu trúc trực tiếp, chức năng tải xuống và sao chép một cú nhấp chuột, hỗ trợ các công cụ tìm kiếm chính như Google/Bing nhanh chóng khám phá và lập chỉ mục hiệu quả tất cả các trang quan trọng của trang web.
Đề xuất Liên quan
Trường hợp sử dụng
- Sau khi trang web mới ra mắt, tạo Sitemap hàng loạt cho các trang cốt lõi, gửi đến Google Search Console và Bing Webmaster Tools để tăng tốc công cụ tìm kiếm khám phá và lập chỉ mục
- Sau khi thiết kế lại chuyên mục trang web hoặc điều chỉnh cấu trúc URL, tạo lại bản đồ trang web, cập nhật chỉ mục công cụ tìm kiếm để tránh liên kết chết còn sót lại ảnh hưởng đến hiệu suất SEO
- Trang web thương mại điện tử nhập hàng loạt URL danh sách sản phẩm, đặt giá trị changefreq và priority khác nhau theo phân loại sản phẩm, thời gian lên kệ
- Khi trang web cổng thông tin lớn hoặc trang tin tức vượt quá 50.000 URL, tạo nhiều Sitemap theo kênh và tạo tệp chỉ mục Sitemap Index
- Trang web blog cấu hình các tham số tần suất cập nhật và độ ưu tiên hợp lý cho trang bài viết, trang thẻ, trang phân loại, trang lưu trữ
- Trang web doanh nghiệp sắp xếp các loại URL khác nhau như trang sản phẩm, trang tin tức, trang giới thiệu, trang liên hệ, đặt lastmod và priority khác biệt
- Sau khi hoàn thành di chuyển trang web (nâng cấp HTTP lên HTTPS, thay đổi tên miền), tạo lại Sitemap và gửi, hướng dẫn crawler nhanh chóng thu thập địa chỉ mới
- Bổ sung thủ công cho Sitemap được tạo bởi các plugin như Yoast SEO, thêm các URL trang đặc biệt mà plugin không bao phủ
- Sau khi tối ưu chẩn đoán SEO, tạo lại Sitemap để đảm bảo cài đặt priority của các trang quan trọng là hợp lý, nâng cao trọng số thu thập dữ liệu của các trang giá trị cao
- Trước khi khai báo vị trí Sitemap thông qua robots.txt, sử dụng công cụ này để xác minh tính đúng đắn của định dạng XML, tránh lỗi phân tích của crawler
Cách Sử dụng
- Dán danh sách địa chỉ trang cần lập chỉ mục vào vùng nhập URL, mỗi dòng một URL hoàn chỉnh (cần bao gồm tiêu đề giao thức http:// hoặc https://)
- Chọn tần suất cập nhật trang trong menu thả xuống changefreq: trang chính chọn daily hoặc hourly, trang bài viết chọn weekly, trang tĩnh chọn yearly hoặc monthly
- Kéo thanh trượt priority hoặc nhập giá trị trong khoảng 0.0-1.0 để đặt độ ưu tiên: trang chính cốt lõi đặt 1.0, trang chuyên mục quan trọng 0.8, trang bài viết thông thường 0.5, trang lưu trữ 0.3
- Nhấp vào bộ chọn ngày lastmod, chọn ngày sửa đổi cuối cùng của nội dung trang web hoặc để trống để không bao gồm trường lastmod
- Xem vùng xem trước trực tiếp ở bên phải, kiểm tra cấu trúc XML được tạo có đúng không, URL không hợp lệ sẽ được đánh dấu màu đỏ để nhắc sửa chữa
- Sau khi xác nhận không có lỗi, nhấp nút「Tải xuống sitemap.xml」để lưu tệp hoặc nhấp nút「Sao chép」để sao chép nội dung XML vào bộ nhớ đệm
- Tải tệp sitemap.xml lên thư mục gốc trang web, thêm khai báo Sitemap trong robots.txt hoặc gửi trực tiếp đến Google Search Console/Bing Webmaster
Tính năng
- Hỗ trợ nhập URL hàng loạt: Mỗi dòng một URL, tự động lọc dòng trống và liên kết lặp lại, xử lý nhanh chóng số lượng lớn địa chỉ trang
- Tự động thoát thực thể XML: Các ký tự đặc biệt như &, <, >, ", ' trong URL được tự động thoát thành &, <, >, ", ', hoàn toàn tránh lỗi phân tích XML
- 7 tùy chọn tần suất cập nhật changefreq: always, hourly, daily, weekly, monthly, yearly, never, bao phủ tất cả các kịch bản loại trang
- Cài đặt độ ưu tiên priority chính xác: Hỗ trợ giá trị bất kỳ trong khoảng 0.0 đến 1.0, hỗ trợ độ chính xác một chữ số thập phân, phân biệt mức độ quan trọng của trang
- Bộ chọn ngày giờ sửa đổi cuối cùng lastmod: Bộ chọn lịch trực quan, tự động định dạng theo tiêu chuẩn W3C Datetime (YYYY-MM-DD)
- Phát hiện URL không hợp lệ theo thời gian thực: Tự động nhận dạng URL có định dạng sai (thiếu giao thức, ký tự bất hợp pháp v.v.), đánh dấu số dòng có vấn đề để thuận tiện sửa chữa
- Xem trước tạo theo thời gian thực: Nội dung XML cập nhật ngay lập tức sau khi sửa đổi danh sách URL hoặc tham số cấu hình, không cần nhấp nút tạo thủ công
- Tải xuống sitemap.xml một cú nhấp chuột: Kết quả tạo được tải trực tiếp dưới dạng tệp XML tiêu chuẩn, sau khi lưu có thể tải lên ngay vào máy chủ trang web
- Cảnh báo giới hạn số lượng URL: Khi số lượng URL nhập vào đạt 50.000, tự động nhắc nhở cần sử dụng phương án tách Sitemap Index
- Sao chép vào bộ nhớ đệm: Sao chép toàn bộ nội dung XML vào bộ nhớ đệm một cú nhấp chuột, thuận tiện dán trực tiếp vào tệp máy chủ hoặc gửi trực tuyến
- Thống kê kích thước byte: Hiển thị số byte của tệp Sitemap XML được tạo theo thời gian thực, đánh giá kích thước tệp có đáp ứng giới hạn của công cụ tìm kiếm hay không
- Đầu ra phần tử gốc urlset tiêu chuẩn: Tuân thủ nghiêm ngặt đặc tả giao thức http://www.sitemaps.org/schemas/sitemap/0.9, bao gồm khai báo không gian tên xmlns chính xác
- Khai báo mã hóa UTF-8: Tự động thêm khai báo mã hóa XML, đảm bảo URL đa ngôn ngữ như tiếng Trung được phân tích chính xác không bị lỗi ký tự
Câu hỏi Thường gặp
Sitemap nhất định phải gửi không? Không gửi trang web sẽ không được lập chỉ mục phải không?
Không gửi Sitemap trang web cũng có thể được lập chỉ mục — công cụ tìm kiếm có thể khám phá trang của bạn thông qua liên kết ngoài từ các trang web khác, theo dõi liên kết nội bộ. Nhưng gửi Sitemap có thể tăng tốc đáng kể tốc độ khám phá, đặc biệt là trang mới, trang web lớn, trang web liên kết nội bộ không hoàn hảo. Google chính thức khuyến nghị tất cả các trang web đều gửi Sitemap, đây là công việc cơ bản SEO chi phí cực thấp lợi nhuận rất cao.
URL trong Sitemap nhất thiết phải là đường dẫn tuyệt đối không? Có thể viết đường dẫn tương đối không?
Phải là URL tuyệt đối hoàn chỉnh, bao gồm tiêu đề giao thức (http:// hoặc https://) và tên miền đầy đủ, không được viết đường dẫn tương đối (như /page1.html) hoặc cách viết bỏ qua giao thức. Khi công cụ tìm kiếm phân tích Sitemap cần URL đầy đủ để thu thập chính xác, đường dẫn tương đối sẽ dẫn đến lỗi phân tích.
Cài đặt changefreq và priority thực sự hữu ích không? Công cụ tìm kiếm có tuân thủ không?
Hai trường này đều là「gợi ý」không phải「lệnh」, công cụ tìm kiếm không nhất thiết tuân thủ 100%, nhưng cài đặt chính xác vẫn có giá trị tham khảo. So với đó lastmod (thời gian sửa đổi cuối cùng) là trường mà công cụ tìm kiếm coi trọng nhất trong ba trường, vì nó có thể trực tiếp thông báo cho crawler trang có nội dung mới hay không. Đừng gian lận đặt tất cả các trang là độ ưu tiên cao nhất hoặc always, điều này sẽ làm cho công cụ tìm kiếm không còn tin tưởng các siêu dữ liệu này.
Tệp Sitemap nhất thiết phải đặt trong thư mục gốc trang web không?
Không nhất thiết, Sitemap có thể đặt ở bất kỳ đường dẫn nào dưới trang web, miễn là URL có thể truy cập bình thường là được. Nhưng robots.txt phải đặt trong thư mục gốc. Nếu bạn sử dụng Sitemap Index tách thành nhiều Sitemap, đường dẫn của Sitemap con không có hạn chế. Tuy nhiên theo thói quen đặt trong thư mục gốc thuận tiện quản lý nhất, cũng thuận tiện cho crawler khám phá.
URL trang web chưa đến 50.000, nhưng kích thước tệp vượt quá 50MB phải làm sao?
Cần tách Sitemap. 50.000 và 50MB là hai giới hạn song song, đáp ứng bất kỳ điều kiện vượt giới hạn nào cũng cần tách. Bạn có thể tách theo loại nội dung, hoặc tinh chỉnh Sitemap (ví dụ loại bỏ khoảng trắng, thụt lề không cần thiết, sử dụng nén gzip), nhưng nếu sau khi nén vẫn vượt quá 50MB thì phải tách.
Có thể bao gồm trang noindex hoặc URL bị robots.txt cấm trong Sitemap không?
Không khuyến nghị. Trong Sitemap chỉ nên bao gồm các trang mà bạn muốn công cụ tìm kiếm thu thập và lập chỉ mục. Trang noindex, trang bị cấm Disallow, trang cần đăng nhập mới truy cập được, trang lỗi 404 đều không nên xuất hiện trong Sitemap, điều này sẽ làm giảm độ tin cậy của công cụ tìm kiếm đối với Sitemap, cũng lãng phí ngân sách thu thập dữ liệu.
Sau khi cập nhật nội dung cần gửi lại Sitemap không? Cập nhật Sitemap bao lâu một lần là phù hợp?
Miễn là URL tệp Sitemap không đổi, công cụ tìm kiếm sẽ định kỳ thu thập lại, không cần gửi lại thủ công mỗi khi cập nhật nội dung. Tần suất cập nhật phụ thuộc vào tần suất cập nhật nội dung trang web của bạn: trang web loại tin tức có thể cập nhật Sitemap hàng ngày thậm chí mỗi giờ (tạo tự động), trang web doanh nghiệp cập nhật hàng tuần hoặc hàng tháng là được. Có thể cài đặt tập lệnh phía máy chủ tự động cập nhật tệp Sitemap.
Sitemap hỗ trợ URL ngôn ngữ nào? URL tiếng Trung cần mã hóa không?
Sitemap hỗ trợ URL ngôn ngữ bất kỳ, nhưng URL ký tự không phải ASCII (như tiếng Trung) cần thực hiện mã hóa URL (còn gọi là mã hóa phần trăm, percent-encoding). Ví dụ「中文页面」phải mã hóa thành dạng %E4%B8%AD%E6%96%87%E9%A1%B5%E9%9D%A2. Hầu hết các trình duyệt và công cụ sẽ xử lý tự động, nhưng bạn cần đảm bảo URL trong Sitemap tạo ra được mã hóa chính xác.
Có thể gửi nhiều Sitemap cùng lúc không? Ví dụ đồng thời có Sitemap bài viết và Sitemap sản phẩm?
Có thể, có hai cách:①Sử dụng tệp chỉ mục Sitemap Index quản lý thống nhất tất cả Sitemap con, đây là cách được khuyến nghị, chỉ cần gửi URL tệp chỉ mục;②Trên nền tảng quản trị gửi lần lượt URL của mỗi Sitemap con, cách này cũng có thể nhưng quản lý phức tạp. Cả hai cách đều hiệu quả, công cụ tìm kiếm đều sẽ thu thập.
Sau khi tạo Sitemap cần nén gzip không? Nén có lợi ích gì?
Không bắt buộc nén, nhưng khuyến nghị mạnh mẽ. Nén gzip thường có thể giảm kích thước Sitemap 70%-80%, tiết kiệm băng thông và thời gian thu thập của crawler, đặc biệt là trang web lớn hiệu quả rõ rệt. Công cụ tìm kiếm hoàn toàn hỗ trợ định dạng nén sitemap.xml.gz, sẽ tự động giải nén. Miễn là sau khi nén không vượt quá 50MB là không vấn đề.
Cả hai phiên bản HTTP và HTTPS của trang web đều cần gửi Sitemap không?
Bạn chỉ nên gửi phiên bản ưu tiên mà bạn muốn được lập chỉ mục. Nếu đã toàn trang HTTPS và thực hiện chuyển hướng 301 HTTP→HTTPS, chỉ cần gửi Sitemap phiên bản HTTPS. Đừng gửi đồng thời cả hai phiên bản HTTP và HTTPS, điều này sẽ dẫn đến vấn đề nội dung lặp lại. Tương tự, www và không www cũng cần xác định tên miền ưu tiên, chỉ gửi Sitemap của tên miền ưu tiên.
WordPress đã dùng Yoast SEO tạo Sitemap, còn cần dùng công cụ này không?
Yoast SEO có thể tự động tạo Sitemap của hầu hết các trang, nhưng có thể bỏ sót một số trang — ví dụ như trang đơn bạn tạo thủ công, tùy chỉnh post type chưa cấu hình tốt, trang đích đặc biệt, trang nhập từ ngoài trang web v.v. Có thể sử dụng công cụ này bổ sung các URL mà Yoast không bao phủ, tạo Sitemap bổ sung riêng lẻ, hoặc kiểm tra đối chiếu Sitemap do Yoast tạo có hoàn chỉnh và chính xác không.
Thứ tự URL trong Sitemap quan trọng không? Đặt trang quan trọng ở phía trước có ích không?
Trong giao thức Sitemap thứ tự URL không có trọng số chính thức nào, công cụ tìm kiếm sẽ không ưu tiên thu thập chỉ vì URL xếp ở phía trước. Nhưng một số người làm SEO quan sát thấy có hiệu quả ưu tiên thứ tự nhẹ, vì vậy đặt URL quan trọng ở phía trước cũng không có hại, nhưng đừng kỳ vọng điều này có thể mang lại hiệu quả rõ rệt, vẫn nên xác định độ ưu tiên chính xác thông qua trường priority.
Trang phân trang (như /list?page=2, /page/3) cần đưa vào Sitemap không?
Điều này phụ thuộc vào giá trị của nội dung phân trang. Nếu phân trang là danh sách lặp lại có tính chất「xem thêm」(như trang thứ 2, thứ 3 của danh sách bài viết), thường không khuyến nghị đưa vào Sitemap, vì các trang này nội dung lặp lại và giá trị thấp, nên tập trung vào trang đầu danh sách và trang bài viết cụ thể. Nhưng nếu phân trang là nội dung độc đáo (như duyệt theo phân loại, phân trang có giá trị độc lập) có thể xem xét bao gồm, đặt priority thấp hơn.
Làm sao để xác minh Sitemap có chính xác và hiệu quả không?
Có một số cách xác minh:①Sau khi tạo bằng công cụ này trước tiên xem trước cấu trúc XML cục bộ có chính xác không, kiểm tra thẻ đóng, không gian tên, ký tự thoát có bình thường không;②Sử dụng công cụ sitemap-inspector xác minh trực tuyến định dạng và khả năng truy cập URL, kiểm tra hàng loạt mã trạng thái HTTP của tất cả URL;③Sau khi tải lên sử dụng trình duyệt truy cập trực tiếp URL Sitemap xem có thể hiển thị bình thường không có lỗi phân tích XML không;④Sau khi gửi đến Google Search Console/Bing Webmaster Tools xem báo cáo trạng thái, xem có lỗi định dạng, URL không thể truy cập, vượt quá giới hạn v.v. nhắc nhở lỗi không, đây là cách xác minh có thẩm quyền nhất;⑤Cũng có thể sử dụng công cụ xác minh XML trực tuyến kiểm tra tính đúng đắn của cú pháp XML.
Xử lý sự cố
Sitemap XML được tạo khi mở trong trình duyệt hiển thị lỗi phân tích, thông báo định dạng không chính xác
URL chứa các ký tự đặc biệt XML như &, <, > không được thoát: khi dán thủ công công cụ đã tự động thoát, nhưng nếu bạn đã chỉnh sửa tệp thủ công có thể bị bỏ sót thoát Khai báo XML hoặc không gian tên urlset viết sai: kiểm tra giá trị xmlns dòng đầu tiên có khớp hoàn toàn http://www.sitemaps.org/schemas/sitemap/0.9 không, không có dấu gạch chéo thừa Thẻ không được đóng chính xác: tất cả thẻ bắt đầu như <url>, <loc> phải có thẻ đóng tương ứng </url>, </loc>, cách viết thẻ tự đóng không được sai Mã hóa tệp không phải UTF-8 có BOM: Notepad Windows có thể lưu thành mã hóa UTF-8 BOM hoặc GBK dẫn đến lỗi phân tích, cần lưu thành UTF-8 không có BOM URL chứa ký tự bất hợp pháp: URL tiếng Trung cần thực hiện mã hóa URL (percent-encoding), ký tự đặc biệt không được mã hóa sẽ dẫn đến lỗi phân tích XML Lỗi khai báo phiên bản XML: dòng đầu tiên phải là <?xml version="1.0" encoding="UTF-8"?>, không được viết thành 1.1 hoặc phiên bản khác Lỗi thứ tự lồng thẻ: thẻ con phải được chứa hoàn toàn trong thẻ cha, không được lồng chéo, như <url><loc></url></loc> thứ tự lỗi này
Sau khi gửi Sitemap trên Google Search Console hiển thị「Không thể đọc Sitemap」hoặc「Lỗi định dạng」
URL tệp Sitemap không thể truy cập: kiểm tra trình duyệt truy cập trực tiếp URL Sitemap có trả về mã trạng thái 200 không, không có lỗi 403/404/500 Máy chủ trả về Content-Type sai: phải trả về application/xml hoặc text/xml, nếu trả về text/html sẽ dẫn đến nhận dạng thất bại Sitemap chứa các URL bị robots.txt cấm thu thập: GSC phát hiện đường dẫn Disallow trong Sitemap sẽ báo lỗi Sự cố chuyển hướng URL: URL của Sitemap nếu 301/302 chuyển hướng đến địa chỉ khác sẽ dẫn đến lỗi, đảm bảo URL có thể truy cập trực tiếp không chuyển hướng HTTP/HTTPS hoặc www/không www không khớp: tên miền Sitemap gửi không nhất quán với tên miền đã xác minh trong GSC (như xác minh là www.example.com nhưng Sitemap sử dụng example.com) Tệp Sitemap quá lớn vượt quá giới hạn 50MB hoặc URL vượt quá 50.000: GSC sẽ từ chối trực tiếp xử lý tệp vượt giới hạn Sử dụng thực thể HTML thay vì thực thể XML: của khoảng trắng là thực thể HTML không phải thực thể XML, không thể sử dụng trong XML
Đã gửi Sitemap rất lâu rồi, nhiều URL vẫn chưa được Google lập chỉ mục
Vấn đề chất lượng trang: lập chỉ mục không phải là gửi là chắc chắn có, các trang có tính nguyên bản nội dung kém, nội dung lặp lại, giá trị nội dung thấp Google có thể chọn không lập chỉ mục Thời kỳ xem xét trang web mới (hiệu ứng hộp cát): trang web mới sau khi gửi Sitemap có thể cần vài tuần đến vài tháng thời kỳ quan sát mới lập chỉ mục hàng loạt Trang là noindex: trong trang mà URL trả về có thẻ meta noindex hoặc tiêu đề phản hồi X-Robots-Tag: noindex, Google sẽ chủ động loại trừ Ngân sách thu thập trang web không đủ: trọng số trang web thấp, máy chủ phản hồi chậm, cấu trúc liên kết nội bộ kém, tần suất thu thập mà Googlebot phân bổ thấp, cần thêm thời gian Sitemap chứa số lượng lớn URL chất lượng thấp: nếu nhiều trong Sitemap là lỗi 404, 5xx, nội dung lặp lại, trang giá trị thấp, Google sẽ làm giảm độ tin cậy đối với toàn bộ Sitemap Tên miền bị phạt: trang web tồn tại vấn đề vi phạm hướng dẫn chất lượng Google (như gian lận, nội dung rác, phần mềm độc hại) dẫn đến lập chỉ mục bị cản trở Trang là trang cô lập: trang mặc dù trong Sitemap, nhưng liên kết nội bộ trang web không có bất kỳ đầu vào nào, crawler có thể coi là không quan trọng mà không lập chỉ mục
Sitemap hiển thị đã phát hiện URL, nhưng số lượng chỉ mục thực tế rất ít
Đây là hiện tượng bình thường:「Đã phát hiện」chỉ biểu thị Google đã truy cập Sitemap nhìn thấy URL, không có nghĩa là sẽ lập chỉ mục tất cả, tỷ lệ lập chỉ mục phụ thuộc vào chất lượng trang Vấn đề nội dung lặp lại: nhiều URL có nội dung tương đồng cao (như cùng một trang với các tham số khác nhau, phiên bản in, phân trang), Google sẽ chọn một phiên bản chuẩn để lập chỉ mục Thẻ chuẩn hóa (canonical) trỏ đến trang khác: trang đã đặt <link rel="canonical" href="URL khác">, Google sẽ lập chỉ mục địa chỉ mà canonical trỏ đến Nội dung trang quá đơn giản: số từ nội dung quá ít, không có giá trị thực chất, nội dung thu thập, Google coi là không đáng lập chỉ mục Tốc độ tải trang quá chậm: máy chủ phản hồi quá thời gian, trang tải quá chậm, sau khi crawler thu thập thất bại nhiều lần sẽ làm giảm độ ưu tiên thu thập Vấn đề chứng chỉ HTTPS: chứng chỉ SSL không hợp lệ, lỗi nội dung hỗn hợp, phiên bản HTTP/HTTPS đồng thời tồn tại dẫn đến vấn đề chuẩn hóa Vấn đề thích ứng di động: tính thân thiện với di động kém, lỗi thích ứng di động, trong môi trường chỉ mục ưu tiên di động ảnh hưởng đến lập chỉ mục
Bing có thể thu thập Sitemap bình thường nhưng Google hoàn toàn không thu thập
Vấn đề xác minh Google Search Console: xác nhận xác minh quyền sở hữu tên miền còn hiệu lực, tên miền đã xác minh (www/không www, http/https) nhất quán với phiên bản truy cập thực tế Tường lửa máy chủ hoặc CDN đã chặn Googlebot: kiểm tra nhật ký truy cập máy chủ xem yêu cầu của Googlebot (user-agent chứa Googlebot) có bị chặn hoặc trả về 403 không Vấn đề phân giải DNS: IP mà DNS của Google phân giải đến khác với Bing, đảm bảo tất cả các khu vực có thể phân giải bình thường đến máy chủ của bạn robots.txt có hạn chế đặc biệt đối với Googlebot: kiểm tra xem dưới User-agent: Googlebot có quy tắc Disallow đặc biệt nào không Trang web trước đây có lịch sử gian lận bị Google giảm thứ hạng: tên miền từng bị phạt thủ công cần đăng ký xem xét lại trước URL Sitemap chứa nội dung mà Google coi là không an toàn: như tên miền bị đánh dấu là phần mềm độc hại, nội dung lừa đảo Quy tắc WAF của CDN chặn nhầm: một số quy tắc bảo mật có thể đánh giá nhầm hành vi crawler Googlebot, cần kiểm tra nhật ký bảo mật CDN
Sitemap được tạo kiểm tra cục bộ bình thường, sau khi tải lên máy chủ truy cập trả về lỗi 404
Đường dẫn tệp không đúng: sitemap.xml không được tải lên thư mục chính xác, xác nhận đã tải lên vị trí tương ứng với URL bạn khai báo trong robots.txt và gửi cho công cụ tìm kiếm Vấn đề chữ hoa chữ thường tên tệp: máy chủ Linux/Unix phân biệt chữ hoa chữ thường, Sitemap.xml và sitemap.xml là các tệp khác nhau, đảm bảo tên tệp toàn bộ là chữ thường Cấu hình Nginx/Apache cấm truy cập tệp xml: kiểm tra cấu hình máy chủ xem có quy tắc location từ chối truy cập tệp hậu tố .xml hoặc trả về quy tắc try_files sai không Vấn đề quyền tệp: quyền tệp trên máy chủ cài đặt không chính xác (như quyền 600), người dùng máy chủ Web không có quyền đọc, thường cần quyền 644, thư mục cần quyền 755 CDN đã lưu bộ đệm phản hồi 404 cũ: tệp vừa tải lên CDN có thể vẫn đang lưu bộ đệm 404 trước đó, cần làm mới bộ đệm CDN hoặc chờ CDN tự động cập nhật lại nguồn Xung đột quy tắc liên kết cố định của CMS như WordPress: quy tắc viết lại của CMS đã chặn sitemap.xml, cần cấu hình quy tắc loại trừ để máy chủ truy cập trực tiếp tệp tĩnh Máy chủ đã cấu hình chống sao chép liên kết hoặc kiểm soát truy cập: quy tắc kiểm tra referer, danh sách trắng IP v.v. trong cấu hình .htaccess hoặc Nginx có thể chặn truy cập crawler
Thuật ngữ
- Sitemap (Sơ đồ trang web)
- Tệp tiêu chuẩn giao thức XML thông báo cho công cụ tìm kiếm về tất cả các trang trên trang web có sẵn để thu thập dữ liệu, bao gồm danh sách URL hoàn chỉnh và thông tin siêu dữ liệu của mỗi URL, giúp các crawler như Googlebot, Bingbot khám phá, hiểu và thu thập nội dung trang web thông minh và hiệu quả hơn, được tổ chức sitemaps.org duy trì tiêu chuẩn giao thức mở thống nhất (phiên bản hiện tại 0.9).
- urlset
- Phần tử gốc của tệp Sitemap XML tiêu chuẩn, phải bao gồm khai báo không gian tên xmlns chính xác, lồng bên trong tất cả các mục phần tử con <url>, là dấu hiệu cốt lõi của tính hợp lệ Sitemap, Sitemap thiếu cấu trúc urlset chính xác sẽ bị công cụ tìm kiếm từ chối phân tích trực tiếp.
- Sitemap Index
- Tệp chỉ mục bản đồ trang web, phải sử dụng khi số lượng URL trang web vượt quá 50.000 hoặc kích thước tệp Sitemap đơn lẻ vượt quá 50MB, phần tử gốc là <sitemapindex>, được sử dụng để liệt kê và quản lý thống nhất địa chỉ nhiều tệp Sitemap con, là phương án tiêu chuẩn hỗ trợ các trang web lớn tách Sitemap.
- changefreq
- Phần tử siêu dữ liệu tùy chọn trong Sitemap, được sử dụng để chỉ định tần suất cập nhật ước tính của nội dung trang, có tổng cộng bảy giá trị hợp lệ là always, hourly, daily, weekly, monthly, yearly, never, để crawler công cụ tìm kiếm tham khảo sắp xếp tần suất thu thập truy cập lại, cài đặt hợp lý có thể tối ưu phân bổ ngân sách thu thập dữ liệu.
- priority
- Phần tử siêu dữ liệu tùy chọn trong Sitemap, được sử dụng để chỉ định độ ưu tiên mức độ quan trọng của URL này so với các trang khác trong trang web, phạm vi giá trị là số thập phân từ 0.0 đến 1.0, giá trị mặc định là 0.5, priority chỉ ảnh hưởng đến độ ưu tiên thu thập tương đối của các trang trong trang web, không ảnh hưởng đến thứ hạng kết quả tìm kiếm.
- lastmod
- Phần tử siêu dữ liệu tùy chọn trong Sitemap, ghi lại ngày và giờ của lần sửa đổi nội dung đáng kể cuối cùng của trang, định dạng phải tuân thủ đặc tả W3C Datetime, là trường mà công cụ tìm kiếm coi trọng nhất trong ba trường siêu dữ liệu tùy chọn, vì nó trực tiếp chỉ thị trang có nội dung mới cần thu thập lại hay không.
- loc
- Phần tử con bắt buộc dưới phần tử <url>, được sử dụng để chỉ định địa chỉ URL tuyệt đối hoàn chỉnh của trang, phải bắt đầu bằng giao thức http:// hoặc https://, bao gồm tên miền đầy đủ, tổng độ dài URL không được vượt quá 2048 ký tự, không được phép sử dụng đường dẫn tương đối.
- Không gian tên XML (xmlns)
- Thuộc tính không gian tên XML phải được khai báo bởi phần tử gốc urlset, giá trị thuộc tính phải khớp chính xác với http://www.sitemaps.org/schemas/sitemap/0.9, được sử dụng để xác định phiên bản giao thức được sử dụng bởi Sitemap, thiếu hoặc viết sai không gian tên sẽ dẫn đến lỗi phân tích Sitemap.
- W3C Datetime
- Định dạng biểu thị ngày và giờ được quy định bởi W3C (World Wide Web Consortium), trường lastmod trong Sitemap phải tuân thủ định dạng này, thường sử dụng định dạng ngày đơn giản hóa YYYY-MM-DD (khả năng tương thích tốt nhất), cũng hỗ trợ định dạng ngày giờ đầy đủ bao gồm giờ phút giây và thông tin múi giờ.
- Thoát thực thể XML
- Các ký tự đặc biệt trong cú pháp XML phải được thoát thành tham chiếu thực thể tương ứng để phân tích chính xác: & thoát thành &, < thoát thành <, > thoát thành >, " thoát thành ", ' thoát thành ', khi URL chứa các ký tự này phải thoát, nếu không sẽ dẫn đến lỗi phân tích XML.
- Google Search Console (GSC)
- Công cụ nền tảng quản trị trang web chính thức do Google cung cấp, được sử dụng để gửi Sitemap, xem trạng thái chỉ mục trang web, phân tích dữ liệu lưu lượng truy cập tìm kiếm, báo cáo lỗi thu thập dữ liệu, thông báo vấn đề bảo mật, thông báo phạt thao tác thủ công v.v., là công cụ cần thiết cho tối ưu hóa công cụ tìm kiếm (SEO) Google.
- Bing Webmaster Tools
- Nền tảng quản trị trang web chính thức của công cụ tìm kiếm Microsoft Bing, chức năng tương tự Google Search Console, hỗ trợ gửi Sitemap, thống kê tỷ lệ bao phủ chỉ mục, phân tích chẩn đoán SEO, nghiên cứu từ khóa, truy vấn liên kết ngược v.v., bao phủ lưu lượng truy cập tìm kiếm của hai công cụ tìm kiếm lớn Bing và Yahoo.
- robots.txt
- Tệp văn bản thuần túy được lưu trữ trong thư mục gốc của trang web, thông qua các lệnh như User-agent, Disallow, Allow thông báo cho crawler công cụ tìm kiếm đường dẫn nào được phép thu thập, đường dẫn nào bị cấm thu thập, đồng thời cũng có thể khai báo vị trí tệp Sitemap trong tệp để crawler tự động khám phá.
- Trình thu thập dữ liệu (Crawler/Spider/Bot)
- Chương trình tự động thu thập nội dung trang web do công cụ tìm kiếm phát triển, như Googlebot (trình thu thập Google), Bingbot (trình thu thập Bing), Baiduspider (trình thu thập Baidu), khám phá trang mới thông qua theo dõi liên kết trang và đọc tệp Sitemap, sau khi tải nội dung trang xuống lưu vào kho chỉ mục của công cụ tìm kiếm.
- Ngân sách thu thập dữ liệu (Crawl Budget)
- Tổng lượng tài nguyên thu thập dữ liệu mà công cụ tìm kiếm phân bổ cho một trang web trong một chu kỳ thời gian nhất định, được quyết định chung bởi nhiều yếu tố như trọng số tên miền trang web, tốc độ phản hồi máy chủ, chất lượng nội dung trang, hiệu quả thu thập lịch sử v.v., cấu hình Sitemap chính xác có thể giúp tối ưu hiệu quả sử dụng ngân sách thu thập dữ liệu.
- Mã hóa UTF-8
- Mã hóa ký tự bắt buộc phải sử dụng cho tệp Sitemap XML, UTF-8 hỗ trợ tất cả các ký tự Unicode bao gồm cả tiếng Trung, được chỉ định thông qua thuộc tính encoding="UTF-8" trong khai báo XML, sử dụng mã hóa khác (như GBK, GB2312) có thể dẫn đến lỗi ký tự URL tiếng Trung và lỗi phân tích.
- Nén gzip
- Giao thức Sitemap hỗ trợ sử dụng thuật toán gzip để nén truyền (phần mở rộng tệp là .xml.gz), có thể giảm kích thước tệp Sitemap 70%-80%, tiết kiệm đáng kể băng thông máy chủ và thời gian thu thập của crawler, các công cụ tìm kiếm chính đều có thể tự động giải nén xử lý tệp Sitemap nén gzip, sau khi nén vẫn cần tuân thủ giới hạn kích thước 50MB.
- Yoast SEO
- Plugin SEO được sử dụng rộng rãi trên các nền tảng CMS như WordPress, Shopify, có thể tự động tạo Sitemap, thẻ meta, điều hướng breadcrumb, sơ đồ trang web XML, tối ưu RSS, siêu dữ liệu mạng xã hội v.v. các chức năng liên quan đến SEO, là giải pháp SEO thường được sử dụng cho các trang web loại nội dung.
- Tỷ lệ bao phủ chỉ mục (Index Coverage)
- Một trong những báo cáo cốt lõi trong Google Search Console, hiển thị chi tiết số lượng cụ thể và chi tiết nguyên nhân của các trang trong trang web được Google lập chỉ mục, loại trừ, xuất hiện lỗi, có cảnh báo, có thể được sử dụng để xác minh hiệu quả gửi Sitemap và chẩn đoán sự cố lập chỉ mục trang.
- Mã hóa URL (Percent-Encoding)
- Còn gọi là mã hóa phần trăm, là phương pháp mã hóa được sử dụng để biểu thị ký tự không phải ASCII (như tiếng Trung, ký tự đặc biệt) trong URL, ký tự tiếng Trung sẽ được mã hóa thành dạng %XX%XX%XX (ví dụ「中文」mã hóa thành %E4%B8%AD%E6%96%87), URL tiếng Trung trong Sitemap phải được mã hóa chính xác mới có thể được phân tích.
Bảng đối chiếu kịch bản tần suất cập nhật changefreq
| Giá trị changefreq | Tần suất cập nhật | Loại trang áp dụng điển hình | Lưu ý |
|---|---|---|---|
always | Mỗi lần truy cập có thể thay đổi | Trang dữ liệu thời gian thực, đầu vào tìm kiếm, trang tổng hợp động | Không có nghĩa là crawler đến mỗi lần, chỉ là tần suất thay đổi cực cao; không lạm dụng, trang thông thường không đặt là always |
hourly | Cập nhật mỗi giờ | Trang chủ tin tức, động mạng xã hội, trang giá thời gian thực | Phù hợp với trang có nội dung mới sản xuất mỗi giờ, trang web cập nhật không thường xuyên không đặt là hourly |
daily | Cập nhật hàng ngày | Trang chủ trang web, trang danh sách blog, trang kênh tin tức, trang phân loại sản phẩm | Một trong những giá trị phổ biến nhất, trang chủ và trang chuyên mục của hầu hết các trang web áp dụng |
weekly | Cập nhật hàng tuần | Trang chi tiết bài viết thông thường, trang chi tiết sản phẩm, trang nội dung blog | Trang nội dung chính của hầu hết các trang web loại nội dung sử dụng cái này là phù hợp |
monthly | Cập nhật hàng tháng | Trang danh mục phân loại, trang lưu trữ, trang FAQ, trang hướng dẫn sử dụng | Trang phụ trợ cập nhật nội dung không thường xuyên nhưng thỉnh thoảng điều chỉnh |
yearly | Cập nhật hàng năm | Trang giới thiệu công ty, trang liên hệ, điều khoản dịch vụ, chính sách bảo mật | Trang thông tin tĩnh hầu như không thay đổi |
never | Không bao giờ cập nhật | Lưu trữ bài viết lịch sử, trang sự kiện hết hạn, nội dung cũ đã lưu trữ | Trang xác nhận không sửa đổi nữa đặt là never, nếu có cập nhật nhớ đổi lại kịp thời |
Bảng tham khảo cài đặt độ ưu tiên priority
| Giá trị priority | Cấp độ ưu tiên | Loại trang áp dụng | Tỷ lệ số lượng trang đề xuất |
|---|---|---|---|
1.0 | Cao nhất | Trang chủ trang web, trang đích cốt lõi, đầu vào kênh quan trọng nhất | Toàn bộ trang web chỉ 1-3 trang |
0.8-0.9 | Rất cao | Trang chuyên mục chính, trang phân loại phổ biến, trang sản phẩm cốt lõi, chuyên đề quan trọng | Chiếm khoảng 5-10% tổng số trang |
0.6-0.7 | Khá cao | Trang chuyên mục phụ, trang phân loại con, bài viết phổ biến, chi tiết sản phẩm quan trọng | Chiếm khoảng 10-20% tổng số trang |
0.4-0.5 | Thông thường | Trang chi tiết bài viết thông thường, trang sản phẩm thông thường, trang nội dung thông thường | Chiếm khoảng 40-60% tổng số trang (giá trị mặc định) |
0.2-0.3 | Khá thấp | Trang thẻ, phân trang lưu trữ, lưu trữ bài viết cũ, trang phụ trợ | Chiếm khoảng 15-25% tổng số trang |
0.0-0.1 | Thấp nhất | Trang giá trị thấp, trang nội dung lặp lại, trang không muốn thu thập tập trung | Chiếm trong vòng 5% tổng số trang, 0 không có nghĩa là cấm lập chỉ mục |
Bảng giới hạn đặc tả giao thức Sitemap
| Mục giới hạn | Giá trị giới hạn trên | Mô tả | Phương án xử lý khi vượt giới hạn |
|---|---|---|---|
| Số lượng URL chứa trong một Sitemap đơn lẻ | 50.000 URL | Quy định cứng của giao thức sitemap.org 0.9 | Sử dụng Sitemap Index tách thành nhiều Sitemap con |
| Kích thước tệp Sitemap đơn lẻ khi không nén | 50MB (52428800 byte) | Kích thước tệp gốc bao gồm tất cả thẻ và khoảng trắng | Sử dụng nén gzip, tách Sitemap, tinh chỉnh nhận xét |
| Số lượng Sitemap con mà Sitemap Index có thể chứa | 50.000 | Giới hạn mục URL của chính tệp chỉ mục | Về mặt lý thuyết hỗ trợ 2,5 tỷ URL, trang web thông thường không cần dùng đến |
| Độ dài một URL | 2.048 ký tự | Bao gồm giao thức, tên miền, đường dẫn, tất cả tham số truy vấn | URL quá dài cần tinh chỉnh tham số hoặc thực hiện viết lại URL |
| Định dạng mã hóa mà Sitemap hỗ trợ | UTF-8 | Giao thức yêu cầu bắt buộc, mã hóa khác có thể dẫn đến lỗi phân tích | Đảm bảo sử dụng mã hóa UTF-8 khi lưu tệp |
| Giao thức mà Sitemap hỗ trợ | http:// hoặc https:// | URL phải bao gồm tiêu đề giao thức đầy đủ | Không hỗ trợ các giao thức khác như ftp:// |
| Thời gian phản hồi của crawler sau khi gửi | Vài giờ đến vài ngày | Phụ thuộc vào trọng số trang web và độ phức tạp Sitemap | Không cần gửi lặp lại, kiên nhẫn chờ xử lý là được |
| Kích thước tệp sau khi nén gzip | 50MB | Tệp sau khi nén cũng không được vượt quá giới hạn 50MB | Vượt giới hạn sau khi nén vẫn cần tách Sitemap |
- Trình tạo Authentication Header
- Trình phân tích Cache-Control
- Trình phân tích Content-Disposition
- Trình tạo CORS Header
- Công cụ kiểm tra CORS
- Trình tạo CSP
- Trình chuyển đổi cURL sang mã nguồn
- Kiểm tra Phân tán DNS Toàn cầu
- Tra cứu DNS
- Trình phân tích Forwarded Header
- Trình tạo thẻ Hreflang
- Trình phân tích HSTS
- Trình Phân Tích HTTP Cookie
- Kiểm tra HTTP Headers
- HTTP Request Runner
- Tra cứu Mã trạng thái HTTP
- Tra cứu IP
- Bộ chuyển đổi IPv4
- IPv4 Range Expander
- Hộp công cụ IPv6
- Link Header Parser
- Tra cứu MX
- Port Checker
- Trình tạo tham số URL
- Rate Limit Header Parser
- Trình kiểm tra chuỗi chuyển hướng
- Trình tạo Robots.txt
- Trình kiểm tra Robots.txt
- Security Headers Checker
- Security.txt Generator
- Trình phân tích Set-Cookie
- Kiểm tra mạng trang web
- Trình tạo Sitemap
- Sitemap Inspector
- Kiểm Tra Chứng Chỉ SSL
- Máy tính Mạng con
- URL Parser
- công cụ phân tích User-Agent
- UTM Builder
- WebSocket Tester
- What Is My IP?
- Tra cứu WHOIS