در دو سال گذشته، فایلی به نام llms.txt به یکی از موضوعات پرتکرار در گفتوگوهای حوزه سئو و «دیدهشدن در هوش مصنوعی» تبدیل شده است. بسیاری از مدیران سایت این فایل را با این تصور میسازند که حضورشان در پاسخ ابزارهایی مانند ChatGPT یا Perplexity بهتر میشود. اما تا پیش از این، شواهد در دسترس بیشتر به تجربههای پراکنده و آزمایشهای کوچک محدود بود.
شرکت Ahrefs در پژوهشی که در خرداد ۱۴۰۵ (ژوئن ۲۰۲۶) منتشر کرد، لاگ سرور و ترافیک زنده حدود ۱۳۷ هزار دامنه را بررسی کرده تا به یک پرسش ساده پاسخ دهد: چه کسی واقعاً این فایلها را میخواند؟ نتایج، تصویر تازهای پیش روی ما میگذارد.
فایل llms.txt دقیقاً چیست؟
llms.txt یک فایل متنی ساده با قالب Markdown است که در ریشه سایت قرار میگیرد. این ایده در سال ۲۰۲۴ توسط جرمی هاوارد (از بنیانگذاران fast.ai و Answer.AI) مطرح شد. هدف اولیه آن روشن بود: سایت در یک صفحه کوتاه معرفی شود و مهمترین صفحاتش فهرست شوند تا مدلهای زبانی و عاملهای هوش مصنوعی بدون نیاز به خزیدن در کل سایت، ساختار آن را بفهمند.
دو نکته را باید از هم جدا کرد:
- این فایل با انتشار نسخه Markdown تکتک صفحات سایت متفاوت است؛ آن یک رویکرد جداگانه با ملاحظات خودش است.
- برخلاف شباهت اسمی، این فایل مانند
robots.txtیک دستورالعمل نیست؛ چیزی را مسدود یا کنترل نمیکند و صرفاً جنبه اطلاعرسانی دارد.
نگاه «افزایش دیدهشدن در هوش مصنوعی» بعدها و عمدتاً از سوی جامعه سئو به این فایل نسبت داده شد؛ بر پایه این گمان که پلتفرمهای هوش مصنوعی در آینده به آن امتیاز خواهند داد.
پیامهای متناقض از سوی گوگل
جالب اینجاست که گوگل در فاصله کمتر از یک هفته، هر دو سوی این بحث را نمایندگی کرد. در راهنمای بهینهسازی برای قابلیتهای هوش مصنوعی مولد، بخشی با عنوان «افسانهزدایی» تصریح میکند که برای حضور در جستوجوی مبتنی بر هوش مصنوعی، نیازی به فایلهای ویژه ماشینخوان نیست. اما چند روز بعد، تیم Chrome یک بررسی مربوط به llms.txt را در ممیزیهای آزمایشی Lighthouse اضافه کرد؛ با این استدلال که نبودِ این فایل ممکن است زمان بیشتری از عاملها برای درک ساختار سایت بگیرد.
جان مولر از گوگل در پاسخ به این تناقض توضیح داد که این فایل «برای جستوجو» طراحی نشده و بیشتر یک راهحل موقت است تا ابزارهای کدنویسی هوش مصنوعی هنگام خواندن مستندات فنی، توکن کمتری مصرف کنند. او همچنین یادآور شد که مدیران سایت اگر لاگهای خود را بررسی کنند، ترافیک بسیار کمی از عاملهای هوش مصنوعی خواهند دید.
پژوهش Ahrefs دقیقاً همین ادعا را به آزمون گذاشت.
روش بررسی
پژوهشگران تمام ۱۳۷٬۲۱۰ دامنهای را که در اردیبهشت/خرداد ۱۴۰۵ (می ۲۰۲۶) ترافیک داشتند بررسی کردند: ابتدا وجود فایل llms.txt با پاسخ سالم سرور در ریشه هر دامنه بررسی شد، سپس تمام درخواستهای رسیده به مسیر /llms.txt بر اساس نوع پاسخ سرور و شناسه هر ربات دستهبندی گردید. برای اطمینان، فایلهای جعلی و صفحات خطای پنهان نیز از دادهها حذف شدند.
دو محدودیت را خود پژوهشگران یادآور شدهاند: نمونه آماری به سمت سایتهای فنی و سئو-محور متمایل است، بنابراین نرخ استفاده واقعی در کل وب احتمالاً کمتر است؛ و اینکه استاندارد بودن ساختار فایلها بررسی نشده است.
مهمترین یافتهها در یک نگاه
- ۲۸ درصد از دامنههای بررسیشده (حدود ۳۸ هزار سایت) فایل
llms.txtمنتشر کردهاند. - ۹۷ درصد از این فایلها در بازه یکماهه بررسی، حتی یک بار هم درخواست نشدهاند؛ نه توسط ربات و نه توسط انسان.
- در میان ۳ درصد باقیمانده، ۹۶ درصد درخواستها از سوی رباتها بوده است.
- ۱۹٫۵ درصد درخواستها از رباتهای شناختهشده هوش مصنوعی آمده؛ بیشترین سهم متعلق به GPTBot و پس از آن Claude-Code است.
- ۱۲ درصد درخواستها از ابزارهایی است که این فایل را «مطالعه و ارزیابی» میکنند، نه اینکه از آن استفاده کنند.
- برای سایتهایی که چنین فایلی ندارند، هیچ درخواستی از سوی رباتهای هوش مصنوعی ثبت نشده است.
بیشترِ خوانندگان، ابزارهای هوش مصنوعی نیستند
نکتهای که ممکن است برای بسیاری غافلگیرکننده باشد این است که ۷۷ درصد رباتهایی که این فایل را میخوانند، اصلاً ابزار هوش مصنوعی نیستند. پرترافیکترین دستهها به ترتیب عبارتاند از: ابزارهای ممیزی سئو (۲۱٫۷٪)، رباتهای ناشناس (۱۴٫۹٪)، خزندههای عمومی وب مانند Googlebot (۱۳٫۱٪) و ابزارهای شناسایی فناوری سایتها (۱۱٫۶٪).
حتی در بخش انسانی ماجرا هم قصه جالبی وجود دارد: ربات پیشنمایش لینک در Slack بیش از PerplexityBot این فایلها را واکشی کرده است؛ یعنی صرفاً به این دلیل که متخصصان سئو لینک این فایلها را در گفتوگوهای کاری با یکدیگر به اشتراک میگذارند.
عاملهای هوش مصنوعی، تنها مخاطب واقعی
در میان رباتهای هوش مصنوعی، بیشترین سهم (۱۰٫۵٪) به عاملهای هوش مصنوعی و زیرساختهای مرتبط با آنها تعلق دارد؛ یعنی ابزارهایی که به نمایندگی از کاربر کاری را انجام میدهند. ابزارهای کدنویسی مانند Claude-Code در این دسته بیش از تمام موتورهای جستوجوی هوش مصنوعی، دستیارها و خزندههای آموزشی سراغ این فایل رفتهاند.
در مقابل، رباتهای بازیابی اطلاعات — یعنی همانهایی که هنگام پرسش کاربر، صفحات را برای پاسخدهی زنده میخوانند — تنها ۱٫۱ درصد درخواستها را تشکیل میدهند. این دقیقاً همان گروهی است که بیشتر سایتها به امید جلب توجهشان این فایل را میسازند.
خزندههای آموزش مدلها با ۵٫۳ درصد در جایگاه دوم قرار دارند. به بیان ساده، اگر این فایل تأثیری بر دیدهشدن برند شما داشته باشد، آن تأثیر احتمالاً در مرحله آموزش مدل رخ میدهد، نه در لحظه پاسخدهی به کاربر.
نکتهای درباره امنیت
یکی از یافتههای قابل تأمل این است که فعالترین ربات پژوهشی در این مجموعه داده، خود را با نامی معرفی میکند که به بررسی «تزریق دستور» (Prompt Injection) اشاره دارد. از آنجا که عاملهای هوش مصنوعی طراحی شدهاند تا محتوای این فایل را معتبر تلقی کنند، یک فایل قدیمی، دستکاریشده یا آلوده میتواند هر عاملی را که آن را میخواند گمراه کند. این جنبه امنیتی هنوز کمتر از آنچه باید مورد توجه قرار گرفته است.
پس بالاخره این فایل را بسازیم یا نه؟
پاسخ به هدف شما بستگی دارد.
اگر هدف صرفاً دیدهشدن در ابزارهای جستوجوی هوش مصنوعی است، دادهها چندان دلگرمکننده نیستند: رباتهای بازیابی بهندرت سراغ این فایل میروند، هیچ سامانه هوش مصنوعی بهصورت خودکار دنبال آن نمیگردد، و احتمال بسیار زیاد این است که فایل شما هرگز خوانده نشود.
اما چند مورد در سمت مقابل ترازو قرار دارد:
- ساخت این فایل هزینه چندانی ندارد و پلتفرمهای ساخت سایت مانند Wix آن را بهصورت خودکار تولید میکنند.
- اگر مخاطبان یا مشتریان شما از ابزارهای کدنویسی هوش مصنوعی استفاده میکنند، یا عاملها با سایت شما تعامل دارند، شانس واقعی خواندهشدن وجود دارد.
- اگر آینده جستوجو واقعاً به سمت عاملمحور شدن برود، این فایل ممکن است در لایه عاملها اهمیت پیدا کند.
اگر تصمیم گرفتید این فایل را بسازید، رعایت چند نکته توصیه میشود:
- ابتدا لاگ سرور خود را بررسی کنید تا ببینید آیا اصلاً درخواستی برای این مسیر ثبت شده است یا خیر.
- ساخت آن را به پلتفرم بسپارید و انرژی زیادی صرف تولید دستی نکنید.
- مسیر رسیدن به آن را مشخص کنید. عاملها این فایل را زمانی میخوانند که لینکی یا دستوری آنها را به سمتش هدایت کند، نه بهصورت حدسی.
- با آن مانند کد رفتار کنید: نسخهبندی، محدودکردن دسترسی ویرایش، هشدار برای تغییرات غیرمجاز، پرهیز از نوشتن محتوای دستوریشکل، و لینکدادن فقط به منابعی که خودتان کنترل میکنید.
llms.txt امروز بیشتر شبیه یک زیرساخت نیمهساخته است تا یک استاندارد جاافتاده: پلتفرمها آن را تولید میکنند، ابزارها آن را ارزیابی میکنند و پژوهشگران امنیتی آن را میکاوند — در حالی که «خوانندگان» اصلی هنوز از راه نرسیدهاند.
بهترین رویکرد برای صاحبان کسبوکار، نگاه واقعبینانه است: این فایل را در حد یک اقدام کمهزینه و آیندهنگرانه ببینید، اما برای بهبود واقعی حضورتان در پاسخهای هوش مصنوعی، روی کیفیت محتوا، ساختار فنی سالم سایت و اعتبار برند سرمایهگذاری کنید.