پوشه robots.txt چیست؟
فولدر robots.txt وظیفه محصور کردن دسترسی ربات های گوگل و بقیه موتورهای کاوش به محتوای یک تارنما را به ذمه داراست. در واقعیت، فولدر robots.txt یک پوشه متنی میباشد که به موتورهای کاوش میگوید کدام صفحه های اینترنت را خزش و ایندکس نماید و چه صفحاتی را خزش و ایندکس نکند. خزیدن ربات ها به معنای پژوهش محتوای صفحه های اینترنت میباشد و ایندکس کردن صفحه ها در معنای ذخیره سازی یک ورژن از محتوای صفحه ها در آرشیو گوگل میباشد. موتورهای کاوش در بین صفحه های یک وب سایت خزش (Crawl) می نمایند و آنهارا ایندکس (Index) می نمایند. ربات های کاوش گر پیش از خزش یک برگه از وب سایت، آغاز پوشه robots.txt را میخوانند و بر پایه ی دستور کار های این فولدر، اذن خزیدن یا این که ایندکس صفحه های را پیدا می نمایند. می بایست توجه کرد که چه صفحاتی برای خزش یا این که ایندکس موتورهای کاوش محصور میگردد. صفحاتی مانند لندینگ پیج ها نباید به نادرست برای موتورهای کاوش آموزش سئو مشهد مسدود شوند.
مداقه به کار گیری از فولدر robots.txt
استعمال از پوشه robots.txt این قابلیت را مهیا می نماید که صفحه ها تارنما فقط برای یوزرها اینترنتی پیاده سازی شوند. همینطور سبب میشود صفحه های بی قیمت و نادر محتوا از نگاه موتورهای کاوش نهفته شوند و به وسیله آنها ایندکس نشوند. از آنجایی که کل صفحه های یک وبسایت از عنایت و امنیت یکسانی بهره مند نیستند، بدین ترتیب نیاز به فولدر robots.txt شم میشود. برخی از صفحه ها اصلی تارنما، نیاز به خزش روزمره و ایندکس روزمره دارا هستند و بعضی از صفحه های معدود عنایت ماهی یکبار نیاز به خزش و ایندکس شدن داراهستند. پوشه robots.txt کیفیت خزیده شدن و ایندکس شدن صفحه ها اینترنتوبسایت بوسیله رباتهای جستجو گر را گزینش آموزش سئو در مشهد می نماید.
به کار گیری ربات های جستجو گر از پوشه robots.txt
کلیه ربات های جستجو گر استاندارد به قانون ها و محدودیت ها احترام میگذارند و کاملا آنانرا رعایت می نمایند. یعنی صفحاتی که برای خزش و ایندکس مسدود گردیده اند را بازدید و ایندکس نمیکنند. البته ربات های اسپم به وجود فولدر robots.txt توجهی ندارند و شغل خویش را جاری ساختن میدهند. به مراد مراقبت امنیت محتوا و مخفی کردن آن از حیث ربات های اسپم، خوب میباشد که برای صفحه ها پسورد نهاده گردد. ربات های دیگری نیز وجود دارا هستند که از امرها فولدر robots.txt تبعیت نمیکنند. این ربات ها مسئول رسیدگی امنیت تارنما می باشند و حتی ممکن میباشد شغل خویش را از بخش هایی از وبسایت آغاز نمایند که اذن دسترسی به آنان داده نشده میباشد.
اوامر فولدر robots.txt
فولدر robots.txt تارنما از دو فرمان کلی تقلید می نماید که برای ربات گوگل، یک فرمان دیگر نیز اضافه میگردد:
User-agent
این فرمان برای مقصود گیری یک ربات خاص استعمال می شود. از این فرمان میاقتدار به دو صورت در فولدر robots.txt به کار گرفت.
در حالتی که قصد دادن یک امر به آحاد ربات های کاوشگر وجود داشته باشد، صرفا کافیست پس از عبارت User-agent از نماد “*” استعمال شود. مانند ذیل:
User-agent: *
فرمان بالا بهاین مضمون میباشد که "اوامر فولدر، برای کلیه رباتهای کاوش گر یکسان شغل مینماید."
البته در صورتی قصد دادن یک فرمان خاص فقط به یک ربات خاص مانند ربات گوگل (GoogleBot) وجود داشته باشد، امر بایستی به صورت تحت نوشته گردد:
User-agent: Googlebot
کد بالا بدین مضمون میباشد که "اجرای امرها فولدر، صرفا برای ربات گوگل الزامی میباشد."
Disallow
امر Disallow به رباتهای کاوش گر میگوید که چه فولدرهایی از اینترنتوبسایت را نباید نظارت نمایند. درواقع این امر، بیانکننده URLای از وب سایت میباشد که از رباتهای جستجو گر مخفی میماند.
به صورت نمونه در صورتی رغبت ندارید موتورهای کاوش، تصاویر تارنما تان را ایندکس نمایند، می توانید کل تصاویر وب سایت را باطن یک فولدر در هاستینگ خویش قرار دهید و از دسترس موتورهای کاوش بیرون نمایید.
فرض نمایید که آحاد این تصاویر را درون پوشه "Photos" منتقل کردهاید. برای آنکه به موتورهای کاوش بگویید کهاین تصاویر را ایندکس نکنند، بایستی فرمان تحت را بنویسید:
User-agent: *
Disallow: /photos
دو خط کدنویسی فوق در فولدر robots.txt، به هیچ یک از رباتهای کاوشگر اذن ورود به پوشه تصاویر وب سایتتان را نخواهد بخشید. در کد دستوری بالا، قسمتUser-agent: * میگوید که اجرای این فرمان برای همگی رباتهای جستجو گر الزامی میباشد. نصیب Disallow: /photos نیز بیانکننده این میباشد که ربات، اذن ورود یا این که ایندکس فایل تصاویر تارنما را ندارد.
Allow
ربات خزنده و ایندکس کنندۀ گوگل، Googlebot اسم داراست. این ربات نسبت به بقیه رباتهای کاوشگر، اوامر بیشتری را متوجه می گردد. خلال دستورها “User-agent” و “Disallow”، ربات گوگل فرمان دیگری به اسم “Allow” را نیز فهم و شعور مینماید.
امر Allow این قابلیت و امکان را مهیا می نماید تا ربات گوگل اذن مشاهده یک فولدر، در فولدری که Disallowed گردیدهاست را داشته باشد. در نمونه پیشین کدی را نوشتیم که به رباتهای کاوش، اذن دسترسی به تصاویر وبسایت را نمیبخشید. تک تک تصاویر وبسایت را باطن یک فولدر به اسم Photos قرار دادیم و با فرمان پایین یک پوشه robots.txt ساخت کردیم:
User-agent: *
Disallow: /photos
اکنون فکر کنید باطن این فولدری که در هاستینگ تارنما جایدارد، تصویری به اسم ezweb.jpg وجود داراست که خواستار ایندکس شدن آن بوسیله Googlebot هستیم. با به کار گیری از امر Allow می توانیم به ربات گوگل بگوییم که ایندکس را جاری ساختن دهد:
User-agent: *
Disallow: /photos
Allow: /photos/novin.jpg
این فرمان به ربات گوگل می گوید که اذن مشاهده و ایندکسِ فولدر ezweb.jpg را داراست، برخلاف اینکه پوشه Photos از دسترس رباتهای کاوشگر بیرون گردیدهاست.
افزودن فولدر robots.txt به گوگل کنسول
سرچ کنسول گوگل یا این که به عبارتی وبسمتر گوگل قسمتی برای آزمایش و محاسبه فولدر robots.txt که دسترسی ربات های کاوش گر به آن محصور گردیده است، در لحاظ گرفته میباشد. این ورقه با اسم robots.txt Tester شناخته می گردد. دراین قسمت می قدرت محتوای پوشه robots.txt را وارد نمود و برای گوگل ارسال نمود. بعداز پذیرش گوگل، می اقتدار واحد سنجش محدودیت ربات های گوگل و دسترسی آنها به محتوای وب سایت را گزینه سنجش قرار اعطا کرد.
پوشه robots.txt چیست؟
فولدر robots.txt وظیفه محصور کردن دسترسی ربات های گوگل و بقیه موتورهای کاوش به محتوای یک تارنما را به ذمه داراست. در واقعیت، فولدر robots.txt یک پوشه متنی میباشد که به موتورهای کاوش میگوید کدام صفحه های اینترنت را خزش و ایندکس نماید و چه صفحاتی را خزش و ایندکس نکند. خزیدن ربات ها به معنای پژوهش محتوای صفحه های اینترنت میباشد و ایندکس کردن صفحه ها در معنای ذخیره سازی یک ورژن از محتوای صفحه ها در آرشیو گوگل میباشد. موتورهای کاوش در بین صفحه های یک وب سایت خزش (Crawl) می نمایند و آنهارا ایندکس (Index) می نمایند. ربات های کاوش گر پیش از خزش یک برگه از وب سایت، آغاز پوشه robots.txt را میخوانند و بر پایه ی دستور کار های این فولدر، اذن خزیدن یا این که ایندکس صفحه های را پیدا می نمایند. می بایست توجه کرد که چه صفحاتی برای خزش یا این که ایندکس موتورهای کاوش محصور میگردد. صفحاتی مانند لندینگ پیج ها نباید به نادرست برای موتورهای کاوش آموزش سئو مشهد مسدود شوند.
مداقه به کار گیری از فولدر robots.txt
استعمال از پوشه robots.txt این قابلیت را مهیا می نماید که صفحه ها تارنما فقط برای یوزرها اینترنتی پیاده سازی شوند. همینطور سبب میشود صفحه های بی قیمت و نادر محتوا از نگاه موتورهای کاوش نهفته شوند و به وسیله آنها ایندکس نشوند. از آنجایی که کل صفحه های یک وبسایت از عنایت و امنیت یکسانی بهره مند نیستند، بدین ترتیب نیاز به فولدر robots.txt شم میشود. برخی از صفحه ها اصلی تارنما، نیاز به خزش روزمره و ایندکس روزمره دارا هستند و بعضی از صفحه های معدود عنایت ماهی یکبار نیاز به خزش و ایندکس شدن داراهستند. پوشه robots.txt کیفیت خزیده شدن و ایندکس شدن صفحه ها اینترنتوبسایت بوسیله رباتهای جستجو گر را گزینش آموزش سئو در مشهد می نماید.
به کار گیری ربات های جستجو گر از پوشه robots.txt
کلیه ربات های جستجو گر استاندارد به قانون ها و محدودیت ها احترام میگذارند و کاملا آنانرا رعایت می نمایند. یعنی صفحاتی که برای خزش و ایندکس مسدود گردیده اند را بازدید و ایندکس نمیکنند. البته ربات های اسپم به وجود فولدر robots.txt توجهی ندارند و شغل خویش را جاری ساختن میدهند. به مراد مراقبت امنیت محتوا و مخفی کردن آن از حیث ربات های اسپم، خوب میباشد که برای صفحه ها پسورد نهاده گردد. ربات های دیگری نیز وجود دارا هستند که از امرها فولدر robots.txt تبعیت نمیکنند. این ربات ها مسئول رسیدگی امنیت تارنما می باشند و حتی ممکن میباشد شغل خویش را از بخش هایی از وبسایت آغاز نمایند که اذن دسترسی به آنان داده نشده میباشد.
اوامر فولدر robots.txt
فولدر robots.txt تارنما از دو فرمان کلی تقلید می نماید که برای ربات گوگل، یک فرمان دیگر نیز اضافه میگردد:
User-agent
این فرمان برای مقصود گیری یک ربات خاص استعمال می شود. از این فرمان میاقتدار به دو صورت در فولدر robots.txt به کار گرفت.
در حالتی که قصد دادن یک امر به آحاد ربات های کاوشگر وجود داشته باشد، صرفا کافیست پس از عبارت User-agent از نماد “*” استعمال شود. مانند ذیل:
User-agent: *
فرمان بالا بهاین مضمون میباشد که "اوامر فولدر، برای کلیه رباتهای کاوش گر یکسان شغل مینماید."
البته در صورتی قصد دادن یک فرمان خاص فقط به یک ربات خاص مانند ربات گوگل (GoogleBot) وجود داشته باشد، امر بایستی به صورت تحت نوشته گردد:
User-agent: Googlebot
کد بالا بدین مضمون میباشد که "اجرای امرها فولدر، صرفا برای ربات گوگل الزامی میباشد."
Disallow
امر Disallow به رباتهای کاوش گر میگوید که چه فولدرهایی از اینترنتوبسایت را نباید نظارت نمایند. درواقع این امر، بیانکننده URLای از وب سایت میباشد که از رباتهای جستجو گر مخفی میماند.
به صورت نمونه در صورتی رغبت ندارید موتورهای کاوش، تصاویر تارنما تان را ایندکس نمایند، می توانید کل تصاویر وب سایت را باطن یک فولدر در هاستینگ خویش قرار دهید و از دسترس موتورهای کاوش بیرون نمایید.
فرض نمایید که آحاد این تصاویر را درون پوشه "Photos" منتقل کردهاید. برای آنکه به موتورهای کاوش بگویید کهاین تصاویر را ایندکس نکنند، بایستی فرمان تحت را بنویسید:
User-agent: *
Disallow: /photos
دو خط کدنویسی فوق در فولدر robots.txt، به هیچ یک از رباتهای کاوشگر اذن ورود به پوشه تصاویر وب سایتتان را نخواهد بخشید. در کد دستوری بالا، قسمتUser-agent: * میگوید که اجرای این فرمان برای همگی رباتهای جستجو گر الزامی میباشد. نصیب Disallow: /photos نیز بیانکننده این میباشد که ربات، اذن ورود یا این که ایندکس فایل تصاویر تارنما را ندارد.
Allow
ربات خزنده و ایندکس کنندۀ گوگل، Googlebot اسم داراست. این ربات نسبت به بقیه رباتهای کاوشگر، اوامر بیشتری را متوجه می گردد. خلال دستورها “User-agent” و “Disallow”، ربات گوگل فرمان دیگری به اسم “Allow” را نیز فهم و شعور مینماید.
امر Allow این قابلیت و امکان را مهیا می نماید تا ربات گوگل اذن مشاهده یک فولدر، در فولدری که Disallowed گردیدهاست را داشته باشد. در نمونه پیشین کدی را نوشتیم که به رباتهای کاوش، اذن دسترسی به تصاویر وبسایت را نمیبخشید. تک تک تصاویر وبسایت را باطن یک فولدر به اسم Photos قرار دادیم و با فرمان پایین یک پوشه robots.txt ساخت کردیم:
User-agent: *
Disallow: /photos
اکنون فکر کنید باطن این فولدری که در هاستینگ تارنما جایدارد، تصویری به اسم ezweb.jpg وجود داراست که خواستار ایندکس شدن آن بوسیله Googlebot هستیم. با به کار گیری از امر Allow می توانیم به ربات گوگل بگوییم که ایندکس را جاری ساختن دهد:
User-agent: *
Disallow: /photos
Allow: /photos/novin.jpg
این فرمان به ربات گوگل می گوید که اذن مشاهده و ایندکسِ فولدر ezweb.jpg را داراست، برخلاف اینکه پوشه Photos از دسترس رباتهای کاوشگر بیرون گردیدهاست.
افزودن فولدر robots.txt به گوگل کنسول
سرچ کنسول گوگل یا این که به عبارتی وبسمتر گوگل قسمتی برای آزمایش و محاسبه فولدر robots.txt که دسترسی ربات های کاوش گر به آن محصور گردیده است، در لحاظ گرفته میباشد. این ورقه با اسم robots.txt Tester شناخته می گردد. دراین قسمت می قدرت محتوای پوشه robots.txt را وارد نمود و برای گوگل ارسال نمود. بعداز پذیرش گوگل، می اقتدار واحد سنجش محدودیت ربات های گوگل و دسترسی آنها به محتوای وب سایت را گزینه سنجش قرار اعطا کرد.

تن درستی و تندرستی