ตรวจ Sitemap เพื่อค้นหาหน้าที่ขาดและขัดแย้ง
เครื่องมือตรวจ Sitemap
ตรวจ Sitemap XML: ค้นหาหน้าที่หายหรือขัดแย้ง | We.Inc
วาง sitemap.xml เพื่อตรวจ XML หา URL ซ้ำ ใช้ http อยู่นอกโดเมน หรือระบุวันที่ผิด เปรียบเทียบกับหน้าที่คาดไว้และ robots.txt แล้วดาวน์โหลดผลเป็น CSV
เปิด sitemap ของคุณ (มักอยู่ที่ yoursite.com/sitemap.xml) แล้วคัดลอกมาวางที่นี่ หรืออัปโหลดไฟล์ เครื่องมือตรวจ XML และ URL ทุกตัว จากนั้นเปรียบเทียบกับรายการหน้าที่คุณคาดว่าจะมีและ robots.txt เพื่อดูว่าหน้าใดหายไป มีหน้าใดที่ไม่ควรอยู่ หรือมีข้อมูลขัดแย้ง เครื่องมือไม่ได้เข้าเว็บไซต์ของคุณ เพราะเบราว์เซอร์บล็อกการอ่านข้อมูลจากเว็บอื่น ระบบตรวจเฉพาะข้อมูลที่คุณวาง ทุกอย่างทำงานในเบราว์เซอร์ ไม่มีการส่งข้อความที่คุณพิมพ์ไปยัง We.Inc หรือที่อื่น และข้อมูลจะหายไปเมื่อปิดแท็บ
- วางเนื้อหาใน sitemap.xml หรืออัปโหลดไฟล์ (สูงสุด 10 MB) ระบบรู้จักไฟล์ดัชนี sitemap ด้วย และจะแสดง sitemap ย่อยให้คุณนำมาวางทีละไฟล์
- ระบบอ่าน XML ในเบราว์เซอร์ คุณจะเห็นว่าไฟล์ถูกต้องหรือไม่ ใช้ sitemap namespace มาตรฐานหรือไม่ และมี URL กี่รายการเมื่อเทียบกับขีดจำกัด 50,000 URL และ 50 MB
- ตรวจ URL ทุกตัว: ต้องเป็นที่อยู่ https แบบเต็ม อยู่บนโฮสต์เดียวกับรายการอื่น ไม่มี # fragment ไม่มีพารามิเตอร์ติดตาม ไม่ซ้ำ และมีวันที่ lastmod ถูกต้องซึ่งไม่ใช่วันในอนาคต
- เลือกวางรายการหน้าที่คาดว่าจะมี เช่น ลิงก์ในเมนู รายงานจะแสดงหน้าที่ควรมีแต่หายจาก sitemap และหน้าที่อยู่ใน sitemap แต่คุณไม่ได้คาดไว้
- เลือกวาง robots.txt เครื่องมือจะทำเครื่องหมาย URL ใน sitemap ที่ robots.txt บล็อก และแจ้งหาก robots.txt ไม่ได้ชี้ไปยัง sitemap
- ดาวน์โหลดผลเป็น CSV หากต้องการดูรหัสสถานะ canonical และ noindex ของ URL เดียว ให้รันคำสั่ง curl ที่แสดงบนหน้า
- ใส่เฉพาะหน้าที่ต้องการให้แสดงในผลค้นหา: ที่อยู่ https สุดท้ายที่ตอบกลับ 200 ไม่เปลี่ยนเส้นทาง และกำหนด canonical เป็นตัวเอง
- นำหน้าที่ติด noindex ออก sitemap ที่มีหน้าซึ่งคุณบอกเครื่องมือค้นหาว่าอย่าจัดทำดัชนีจะส่งสัญญาณขัดแย้งกัน
- ใช้ lastmod เฉพาะเมื่อทราบวันที่หน้าเปลี่ยนจริง การตั้งทุกหน้าเป็นวันนี้จะทำให้เครื่องมือค้นหาเลิกสนใจช่องนี้
- เพิ่มบรรทัด Sitemap: พร้อมที่อยู่เต็มใน robots.txt เพื่อให้โปรแกรมรวบรวมข้อมูลหา sitemap ได้เอง
- ส่ง sitemap ใน Google Search Console และ Bing Webmaster Tools แล้วตรวจรายงานว่ามีหน้าใดที่ระบบดึงไม่ได้
คำถามที่พบบ่อย
เครื่องมือนี้รวบรวมข้อมูลจากเว็บไซต์ของฉันไหม
ไม่ หน้าเว็บหนึ่งอ่านไฟล์จากอีกเว็บไซต์ไม่ได้เพราะเบราว์เซอร์บล็อก และเราไม่ได้เปิดโปรแกรมรวบรวมข้อมูลแบบซ่อนอยู่ คุณวาง sitemap รายการหน้า และ robots.txt เอง แล้วระบบตรวจข้อความเหล่านั้น รายงานระบุจำนวน URL ที่ตรวจอย่างชัดเจน
ตรวจรหัสสถานะ canonical และ noindex อย่างไร
รัน curl -sIL ตามด้วยที่อยู่หน้าในเทอร์มินัลเพื่อดูรหัสสถานะและการเปลี่ยนเส้นทาง หากต้องการดู canonical และเมตาแท็ก robots ให้รัน curl -sL ตามด้วยที่อยู่ แล้วค้นหา rel="canonical" และ name="robots" ในผลลัพธ์ รายงานการจัดทำดัชนีหน้าของ Search Console แสดงหลักฐานเดียวกันสำหรับทั้งเว็บไซต์
Sitemap มีขีดจำกัดเท่าไร
ไฟล์ sitemap หนึ่งไฟล์เก็บได้สูงสุด 50,000 URL และมีขนาดไม่เกิน 50 MB ก่อนบีบอัด เว็บไซต์ขนาดใหญ่แบ่ง URL ไว้ใน sitemap หลายไฟล์ แล้วระบุรายชื่อไว้ในไฟล์ดัชนี sitemap
ทำไม URL ที่ใช้ http หรืออยู่คนละโดเมนจึงถูกทำเครื่องหมาย
Sitemap ควรระบุที่อยู่สุดท้ายบนเว็บไซต์เดียวกับที่เก็บไฟล์ sitemap ที่อยู่ http บนเว็บไซต์ https จะเปลี่ยนเส้นทาง ส่วน URL บนโฮสต์อื่นจะถูกเครื่องมือค้นหาเพิกเฉย เว้นแต่คุณยืนยันการส่งข้อมูลข้ามเว็บไซต์ไว้แล้ว
Sitemap ที่ถูกต้องหมายความว่าหน้าจะถูกจัดทำดัชนีไหม
ไม่ Sitemap ช่วยให้เครื่องมือค้นหาพบหน้า แต่ไม่ได้ทำให้ระบบจัดทำดัชนีหรือจัดอันดับหน้า คุณภาพ ลิงก์ และสัญญาณทางเทคนิคยังเป็นปัจจัยตัดสิน
ข้อมูลที่ฉันวางถูกเก็บไว้ไหม
ไม่ การตรวจทำงานในเบราว์เซอร์และไม่มีการส่งข้อมูลไปที่ใด
หน้าที่ขาดกับหน้าที่ไม่ควรอยู่ในรายการ
- ข้อผิดพลาดสำคัญมีสองแบบ หน้าที่ขาดคือหน้าจริงที่คุณต้องการให้คนพบแต่ไม่มีใน sitemap มักเป็นหน้าบริการหรือบทความใหม่ที่เพิ่มหลังสร้าง sitemap แล้ว ส่วนหน้าที่ไม่ควรอยู่คือที่อยู่ที่ไม่ควรมี เช่น หน้าที่เปลี่ยนเส้นทาง หน้าทดสอบ หน้ากรองข้อมูลซึ่งซ้ำกับหน้าอื่น หรือหน้าที่ติด noindex
- การเทียบ sitemap กับรายการที่เชื่อถือได้ เช่น ลิงก์ในเมนูและส่วนท้ายเว็บ เป็นวิธีเร็วที่สุดในการหาได้ทั้งสองแบบ เครื่องมือนี้แยกรายการให้เพื่อให้คุณแก้ทีละอย่าง
การตรวจนี้เห็นอะไรได้และไม่ได้บ้าง
- ทุกอย่างที่ตรวจอิงจากข้อความที่คุณวาง ระบบยืนยันได้ว่า XML ถูกต้อง และ URL มีรูปแบบสอดคล้องกันและได้รับอนุญาตใน robots.txt แต่ยืนยันไม่ได้ว่าแต่ละหน้าตอบกลับ 200 ในตอนนี้หรือติดแท็ก noindex หรือไม่ เพราะต้องเข้าไปตรวจทีละหน้า รายงานจะแสดงสถานะ “ยังไม่ได้ตรวจ” แทนการเดา
เริ่มต้นฟรี · ไม่ต้องใช้บัตรเครดิต
Product
Who It's For
Features
Resources
Company
View Sitemap