seo الزحف والفهرسة في SEO: الفرق بين robots.txt وnoindex وcanonical وخريطة الموقع

الرُمح

Moderator
طاقم الإدارة
مشرفين انكور
عضو انكور
قد يكتب صاحب الموقع محتوى ممتازًا ثم يتفاجأ بأن صفحاته لا تظهر في نتائج البحث إطلاقًا، أو أن صفحات مكررة وعديمة القيمة هي التي تظهر بدلًا من صفحاته المهمة. والسبب في أغلب هذه الحالات لا يتعلق بجودة المحتوى، بل بأساسيات السيو التقني، وتحديدًا بعمليتي الزحف والفهرسة. في هذا الشرح نوضح كيف تكتشف محركات البحث صفحاتك، والفرق الدقيق بين أدوات التحكم الأكثر استخدامًا، والأخطاء الشائعة التي قد تخفي موقعك عن جوجل دون أن تشعر.

كيف تعمل محركات البحث: الزحف ثم الفهرسة ثم الترتيب​

تمر الصفحة بثلاث مراحل قبل أن تظهر للباحث. الأولى هي الزحف Crawling، حيث يتنقل برنامج جوجل المعروف باسم Googlebot بين الروابط ليكتشف الصفحات الجديدة والمحدثة. والثانية هي الفهرسة Indexing، وفيها يحلل جوجل محتوى الصفحة ويفهم موضوعها ثم يقرر ما إذا كان سيخزنها في فهرسه الضخم. والثالثة هي الترتيب، أي اختيار الصفحات الأنسب من الفهرس لعرضها عند كل عملية بحث.
والمهم إدراكه أن كل مرحلة تعتمد على التي قبلها، فالصفحة التي لا يُزحف إليها لن تُفهرس، والصفحة غير المفهرسة لن تظهر مهما كانت جودتها. كما أن جوجل لا يفهرس كل ما يزحف إليه، فقد يستبعد الصفحات المكررة أو الضعيفة أو التي يرى أنها لا تضيف قيمة. ولهذا فإن مهمتك كصاحب موقع هي أن تسهل الوصول إلى صفحاتك المهمة، وأن توجه محركات البحث بعيدًا عن الصفحات التي لا ينبغي أن تظهر.
وتظهر أهمية هذه المرحلة أكثر في المواقع الكبيرة، حيث يُخصص لكل موقع قدر معين من موارد الزحف يُعرف بميزانية الزحف. فإذا امتلأ الموقع بآلاف الروابط عديمة القيمة، كصفحات الفرز والتصفية وروابط الجلسات والصفحات المكررة، أنفق Googlebot وقته عليها وتأخر في اكتشاف المحتوى الجديد المهم. ولهذا فإن البنية الواضحة والروابط الداخلية المنظمة وسرعة استجابة الخادم عوامل تساعد على زحف أكفأ.

ملف robots.txt ووسم noindex: الفرق الذي يغفل عنه كثيرون​

ملف robots.txt هو ملف نصي يوضع في جذر الموقع، ويخبر برامج الزحف بالمسارات التي لا يُسمح لها بزيارتها. وهو مفيد لمنع الزحف إلى صفحات لا قيمة لها في البحث، كنتائج البحث الداخلي أو صفحات لوحة التحكم، مما يوفر موارد الزحف للصفحات المهمة. لكن هذا الملف يمنع الزحف لا الفهرسة، فإذا كانت الصفحة المحظورة مرتبطة من مواقع أخرى فقد تظهر في النتائج برابطها فقط دون وصف.
أما إذا أردت إخراج صفحة من نتائج البحث فعلًا، فالأداة الصحيحة هي وسم noindex، سواء وضعته داخل وسم meta في رأس الصفحة أو أرسلته عبر ترويسة X-Robots-Tag من الخادم. وهنا يأتي الخطأ الشائع: الجمع بين الأداتين على الصفحة نفسها. فإذا حظرت صفحة في robots.txt ووضعت فيها noindex، فلن يتمكن جوجل من زيارتها ليقرأ الوسم أصلًا، وقد تبقى في الفهرس. لذلك يجب أن تبقى الصفحة متاحة للزحف حتى يرى جوجل تعليمة noindex ويطبقها.

الرابط الأساسي canonical وعلاج المحتوى المكرر​

كثيرًا ما يصل المحتوى نفسه عبر روابط متعددة، كنسخة بـ www وأخرى بدونها، أو روابط تحمل معاملات تتبع وترتيب، أو صفحات طباعة، أو موضوع في منتدى يظهر بعدة صيغ للرابط. وهذا التكرار يشتت الإشارات بين عدة نسخ ويربك محركات البحث في اختيار النسخة التي تعرضها. وهنا يأتي دور وسم rel=canonical الذي تحدد به النسخة الأساسية المفضلة من الصفحة.
ويجب أن تعلم أن canonical إشارة قوية وليس أمرًا ملزمًا، فجوجل قد يختار نسخة أخرى إذا رأى أن إشاراتك متناقضة. لذلك اجعل جميع إشاراتك متسقة: ضع canonical يشير إلى الرابط النهائي الصحيح، واجعل الروابط الداخلية تشير إلى النسخة نفسها، وأدرجها وحدها في خريطة الموقع، واستخدم التحويل الدائم 301 لتوحيد نسخ النطاق وبروتوكول HTTPS. ولا تستخدم canonical لتوجيه صفحات مختلفة المحتوى إلى صفحة واحدة، فهذا استخدام خاطئ قد يتجاهله جوجل.

خريطة الموقع XML ومتابعة الفهرسة من Search Console​

خريطة الموقع XML ملف يضم قائمة بالروابط التي تريد من محركات البحث أن تكتشفها، وهي مفيدة خصوصًا للمواقع الكبيرة والمنتديات التي تضم آلاف المواضيع، أو المواقع الجديدة التي لا تملك روابط خارجية كثيرة. والقاعدة الأساسية أن تحتوي الخريطة فقط على الصفحات القابلة للفهرسة التي تعيد الرمز 200، دون صفحات محولة أو محظورة أو تحمل noindex، وأن يعكس تاريخ التعديل lastmod تحديثًا حقيقيًا للمحتوى. ويمكنك الإشارة إليها داخل robots.txt وإرسالها عبر Search Console.
ثم يأتي دور المتابعة، فتقرير الفهرسة في Google Search Console يوضح لك الصفحات المفهرسة وغير المفهرسة وأسباب استبعادها، مثل حالة تم الزحف إليها ولم تتم فهرستها حاليًا، أو وجود نسخة مكررة اختار جوجل لها رابطًا أساسيًا مختلفًا. كما تتيح أداة فحص الرابط معرفة حالة أي صفحة بعينها وطلب فهرستها بعد تحديثها. ومراجعة هذا التقرير بانتظام تكشف المشكلات التقنية قبل أن تتحول إلى خسارة في الزيارات.

الخلاصة​

الزحف والفهرسة هما البوابة التي يمر عبرها كل محتوى قبل أن يصل إلى الباحث. استخدم robots.txt لتنظيم الزحف، وnoindex لإخراج الصفحات من النتائج، وcanonical لتوحيد النسخ المكررة، وخريطة الموقع لإرشاد محركات البحث إلى صفحاتك المهمة، واجعل كل هذه الإشارات متسقة غير متعارضة. وإذا واجهتم مشكلة في فهرسة مواقعكم أو منتدياتكم فاطرحوها في الردود لنناقشها معًا.
 

رأيك جزء من المعرفة.

أضف تجربتك أو سؤالك، فالنقاش يكمل الفكرة.

عودة
أعلى