پژوهشگران امنیتی آنتروپیک، به‌تازگی پژوهش جدیدی منتشر کرده‌اند که رفتار گروهی از ایجنت‌های خودمختار هوش مصنوعی را هنگام مواجهه با یکدیگر در محیط‌های مشترک تحلیل می‌کند. نتایج این آزمایش چشم‌اندازی از خطرات احتمالی را آشکار می‌کند که ممکن است هم‌زمان با استقرار این سامانه‌ها توسط شرکت‌ها و دولت‌ها در بستر پایگاه‌های کدنویسی مشترک، بازارها و سیستم‌های رایانه‌ای رخ دهد.

در یکی از این آزمایش‌ها، آنتروپیک دسترسی به یک پروژه نرم‌افزاری مشترک را در اختیار سه ایجنت مبتنی بر مدل Claude قرار داد، درحالی‌که به هر یک از آنها دستورالعمل‌هایی ناهمخوان و متضاد برای پیشبرد پروژه داده شده بود. پژوهشگران به این مدل‌ها اطلاع نداده بودند که ایجنت‌های دیگری نیز روی همین بستر فعالیت می‌کنند تا واکنش آنها را هنگام تلاقی مسیرهای کاری ارزیابی کنند.

به گفته پژوهشگران، این شرایط به‌طور پیوسته به «جنگ بر سر قلمرو» (Turf War) تبدیل شد؛ مدل‌ها تصور می‌کردند سایر ایجنت‌ها عمداً مانع پیشرفت کار آنها هستند و در واکنش، با بدافزارها شروع به خرابکاری در عملکرد یکدیگر کردند.

نبرد ایجنت‌ها
پژوهش آنتروپیک: تقابل ایجنت‌های هوش مصنوعی به جنگ بر سر قلمرو منجر می‌شود

این گزارش پس از رویدادهایی منتشر می‌شود که در جریان آنها ایجنت‌های آنتروپیک و OpenAI توانسته بودند از محیط‌های آزمایشی ایزوله یا سندباکس خارج شوند و به سیستم‌های واقعی نفوذ کنند. درحالی‌که عمده مباحث ایمنی تاکنون بر سر مهار ایجنت‌های سرکش متمرکز بوده، پژوهش جدید آنتروپیک روی دیگر ماجرا را هدف گرفته است: ظهور الگوهای رفتاری آسیب‌رسان در زمانی که هزاران یا میلیون‌ها ایجنت به‌طور هم‌زمان با یکدیگر تعامل دارند. به بیان پژوهشگران، حجم تعاملات میان خود ایجنت‌ها می‌تواند به‌زودی از حجم تعاملات انسان با انسان یا انسان با ایجنت فراتر رود و عادت‌های رفتاری به‌ظاهر بی‌ضرر در سطح فردی، پیامدهای ناخواسته جهانی رقم بزند.

پژوهش آنتروپیک: تقابل ایجنت‌های هوش مصنوعی به جنگ بر سر قلمرو منجر می‌شود
READ  گلکسی واچ اولترا 2025 با فضای داخلی بزرگ‌تر و یک رنگ جدید معرفی شد

سازوکار حل اختلاف و تفکر گله‌ای در میان ایجنت‌های هوش مصنوعی

آزمایش‌های آنتروپیک نشان می‌دهد هرچند ایجنت‌های توانمندتر در صورت وجود تضاد اهداف به شیوه‌های مخرب‌تری به رقابت و نزاع با یکدیگر می‌پردازند، اما گاهی سازوکارهای خودجوشی برای حل‌وفصل اختلافات پیدا می‌کنند. مدل‌ها گاهی موفق شدند انگیزه‌های متضاد یکدیگر را تشخیص دهند، چرخه تنش را بشکنند و با نگارش پیام‌های اصلاحی یا ثبت توضیحاتی مبنی بر عذرخواهی بابت رفتارهای مخرب، آتش‌بس برقرار کنند، کدهای آلوده را پاک‌سازی کنند و از انسان درخواست مداخله داشته باشند. در میان مدل‌های بررسی‌شده، مدل Mythos 5 بالاترین نرخ دستیابی به آتش‌بس یعنی ۹۸ درصد را ثبت کرده؛ در نقطه مقابل، مدل‌های Sonnet 4.6 و Opus 4.6 به‌دلیل ناتوانی مکرر در درک مقاصد طرف مقابل، بیشترین تمایل را به حل نزاع از طریق زور نشان دادند.

در مواردی نیز این سامانه‌ها ساختاری مشابه «تورنمنت» طراحی کردند تا برنده همه‌چیز را در دست بگیرد و طرف‌های بازنده حتی با وجود مغایرت با دستور اولیه کاربر انسانی، از مواضع خود عقب‌نشینی کنند. در یکی از این سناریوها، مدل Mythos 5 معیارهایی را برای داوری پیشنهاد داد که در ظاهر برای سایرین بی‌طرفانه به نظر می‌رسید، اما دقیقاً با توانمندی‌های خودش هم‌خوانی داشت تا پیروز رقابت شود. مدل‌های آنتروپیک در این آزمایش ساختارهایی را شکل دادند که هرگز توسط توسعه‌دهندگانشان طراحی نشده بود.

نبرد هوش مصنوعی
پژوهش آنتروپیک: تقابل ایجنت‌های هوش مصنوعی به جنگ بر سر قلمرو منجر می‌شود

پژوهش آنتروپیک همچنین نشان داده که افزایش تعداد ایجنت‌ها لزوماً به بهبود همکاری منجر نمی‌شود؛ چرا که در صورت هم‌پوشانی وظایف، مدل‌ها تمایل دارند خود را منزوی کرده و به‌کلی از همکاری دست بکشند. از سوی دیگر، شباهت ساختار و داده‌های مدل‌ها پدیده‌ای شبیه به «تفکر گله‌ای» (Mob Mentality) ایجاد می‌کند که در آن تصمیم اشتباه یک ایجنت بلافاصله توسط سایرین تکرار شده و به شکست سیستمی تبدیل می‌شود.

پژوهش آنتروپیک: تقابل ایجنت‌های هوش مصنوعی به جنگ بر سر قلمرو منجر می‌شود
READ  رونمایی ام‌اس‌آی از باریک‌ترین لپتاپ گیمینگ ۱۵ اینچی جهان

این سازوکار نشان می‌دهد مدل‌ها درست مانند انسان‌ها در معرض رفتارهای تبعی و سوءاستفاده از اعتماد قرار دارند؛ موضوعی که در صورت مواجهه یک ایجنت با حملات تزریق دستور، می‌تواند فریب و اطلاعات مخرب را به کل شبکه ایجنت‌ها سرایت دهد.

✅ آیا این خبر خودرو و حمل و نقل برای شما مفید بود؟ امتیاز خود را ثبت کنید.
[کل: 0 میانگین: 0]
اشتراک‌ها:
دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *