ملف robots.txt هو أول ملف يقرأه Googlebot عند زيارته لموقعك. مع تحديث Google Core Update مايو 2026، أصبحت بنية الزحف مؤشراً مباشراً على جودة الموقع. المواقع التي تهدر ميزانية الزحف على صفحات غير مهمة تخسر ترتيبها لصالح مواقع تنظف مسارات الزحف. هذا الدليل يشرح لك كيفية إنشاء وتحسين robots.txt خطوة بخطوة.
ما هو ملف robots.txt ولماذا يهم في 2026؟
robots.txt هو ملف نصي في جذر الموقع يخبر زواحف محركات البحث وأدوات AI بأي الصفحات يمكنها زيارتها وأيها ممنوع. هو بروتوكول طوعي (RFC 9309) - الزواحف المحترمة تتبعه، لكن بعض أدوات الـ scraping تتجاهله.
في 2026، ملف robots.txt ليس مجرد أداة SEO تقنية. أصبح قراراً تحريرياً يتحكم في وصول أكثر من 30 crawler من شركات AI: Google-Extended، GPTBot، Claude-Web، PerplexityBot، وغيرها.
هيكل الملف والـ Directives الأساسية:
| الـ Directive | الوظيفة | مدعوم من |
|---|---|---|
| User-agent | الزاحف المستهدف (* للكل) | الكل |
| Disallow | منع مسار | الكل |
| Allow | السماح بمسار رغم Disallow | Google, Bing |
| Sitemap | رابط خريطة الموقع | Google, Bing, AI |
| Crawl-delay | مهلة بين الطلبات (ثوان) | Bing, Yandex (ليس Google) |
| # | تعليق | الكل |
مثال أساسي لموقع آمن: ``` User-agent: * Disallow:
Sitemap: https://example.com/sitemap.xml ``` هذا يسمح لكل الزواحف بكل شيء ويوجهها إلى خريطة الموقع.
مثال مع حظر المسارات الإدارية: ``` User-agent: * Disallow: /admin/ Disallow: /search? Disallow: /*?utm_
Sitemap: https://example.com/sitemap.xml ```
متى يكون Crawl Budget مهماً؟
Crawl Budget هو عدد الصفحات التي يزحفها Googlebot في فترة زمنية. Google يقررها بناءً على سلطة الموقع وأداء الخادم وتحديث المحتوى. إذا كان موقعك أقل من 10,000 URL، لا تقلق - crawl budget ليس مشكلتك.
لكن إذا تجاوزت 10,000 URL، كل Disallow خاطئ يهدر ميزانية الزحف. الفلترة والفرز والمعامل create سيلاً من ملايين URLs - هذا هو القاتل الصامت للـ crawl budget.
AI Crawlers: إضافة 2026 الاستراتيجية:
في 2026، تتحكم الخيارات التالية في وصول الذكاء الاصطناعي لمحتواك:
| الزاحف | 用途 | القرار التحريري |
|---|---|---|
| GPTBot (OpenAI) | تدريب GPT وجمع محتوى | احجبه → محتواك خارج ChatGPT |
| Claude-Web (Anthropic) | تدريب Claude | مثل GPTBot |
| PerplexityBot | البحث المباشر | اسمح به → يُستشهد بك في Perplexity |
| Google-Extended | تدريب Gemini فقط (ليس بحث) | احجبه للتدريب فقط، اتركه للبحث |
| Applebot-Extended | تدريب Apple AI | احجبه للتدريب |
مثال للحظر الانتقائي: ``` User-agent: GPTBot Disallow: /
User-agent: Claude-Web Disallow: /
User-agent: Google-Extended Disallow: /
User-agent: PerplexityBot Disallow:
User-agent: * Disallow:
Sitemap: https://example.com/sitemap.xml ```
أخطاء تقفل موقعك بالكامل:
1. Disallow: / منقول من بيئة التطوير إلى الإنتاج - هذا هو أخطر خطأ. يمنع كل الزحف. الموقع يختفي من Google تدريجياً.
2. حظر CSS و JS - Google يرون موقعاً مشوهاً، مما يؤثر على تقييم Core Web Vitals وجودة المحتوى.
3. الجمع بين noindex و robots.txt - إذا حجبت صفحة في robots.txt، Google لا تستطيع قراءة noindex، وقد تبقى الصفحة في الفهرس.
4. تجاهل AI crawlers - هذا قرار استراتيجي يحتاج وعياً، ليس إهمالاً.
5. عدم وجود Sitemap declaration - ضع Sitemap: في أسفل الملف.
6. Slash غير متسق - /admin يختلف عن /admin/ الأول يمنع URL واحد، الثاني يمنع الدليل كاملاً.
7. UTF-8 BOM - بعض المحررين يضيفون Byte Order Mark في بداية الملف مما يسبب مشاكل.
أفضل الممارسات: - اجعل الملف بسيطاً. 3 توجيهات تكفي 90% من المواقع - اختبر أي تغيير بـ Google Search Console > Settings > Robots.txt Tester - لا تستخدم robots.txt كأداة أمنية - الملف عام وأي شخص يقرؤه - حافظ على دليل Sitemap محدثاً - راجع الملف بعد كل ترحيل أو تغيير كبير للموقع - للمحتوى الحساس الحقيقي، استخدم المصادقة (password protection)، ليس robots.txt
افحص ملف robots.txt لموقعك مع Waxbix SEO Tool واكتشف الأخطاء قبل أن تكلفك ترتيبك.
