خانه
اخبار اقتصادی و عمومی
تکنولوژی
آنتروپیک کاربران را به چالش کشید: اگر می‌توانید هوش مصنوعی ما را جیلبریک کنید

آنتروپیک کاربران را به چالش کشید: اگر می‌توانید هوش مصنوعی ما را جیلبریک کنید

دیجیاتو2 ماه قبل

2 ماه قبل

2 دقیقه

51,0 بازدیدها

0 دیدگاه

آنتروپیک از عموم خواسته با شرکت در آزمایش، توانایی سیستم جدید هوش مصنوعی‌اش را به چالش بکشند.

می‌توانید سیستم جدید محافظتی مدل Claude از شرکت Anthropic را شکست دهید؟ پس از ۳ هزار ساعت تلاش بی‌نتیجه در برنامه «Bug Bounty»، این شرکت اکنون به شما این فرصت را می‌دهد تا در آزمایشی عمومی این مدل هوش مصنوعی را به چالش بکشید.

آنتروپیک به‌تازگی سیستم جدیدی موسوم به Constitutional Classifiers معرفی کرده که به گفته‌ این شرکت، می‌تواند تلاش‌ برای شکستن قواعد و محدودیت‌های مدل هوش مصنوعی Claude را فیلتر کند. طبق گزارش «Arstechnica» این سیستم با هدف مقابله با حملات و درخواست‌های غیرمجاز طراحی شده و از زمان آغاز آزمایش‌های داخلی تاکنون، توانسته از بیش از ۳ هزار ساعت تلاش باگ بانتی جلوگیری کند.

این شرکت از همه دعوت کرده وارد عرصه آزمایش شوند و ببینند می‌توانند این مدل را در رسیدن به نتایج غیرمجاز شکست دهند یا خیر. آنتروپیک از کاربران می‌خواهد سعی کنند مدل Claude را به پاسخ‌دادن به 8 سؤال درباره سلاح‌های شیمیایی وادار کنند.

سیستم جدید آنتروپیک بر پایه مجموعه‌ای از قواعد طبیعی زبان شکل گرفته که اطلاعات مجاز و غیرمجاز برای مدل را تعریف می‌کند. این سیستم به‌گونه‌ای طراحی شده که تلاش‌های کاربران برای دسترسی به اطلاعات حساس را شناسایی و فیلتر کند، حتی اگر به شیوه‌های پیچیده یا در قالب داستان‌های غیرواقعی پنهان شوند.

این سیستم توانسته در برابر ۱۰ هزار حمله شبیه‌سازی‌شده که برای آزمایش آسیب‌پذیری‌های مدل ایجاد شده بودند، واکنش مؤثری نشان دهد. از سوی دیگر، این مدل توانسته ۹۵ درصد این حملات را مسدود کند اما مدل قبلی این میزان موفقیت را فقط با نرخ ۱۴ درصد داشت.

چطور می‌توان مدل Claude را دور زد و قوانین جدید آن را شکست؟

آنتروپیک همچنین برنامه‌ای به نام «Bug Bounty» اجرا کرده و از کارشناسان و متخصصان خواسته بود جیلبریکی طراحی کنند که بتواند سیستم محافظتی مدل Claude را دور بزند. پس از ماه‌ها تلاش، فقط برخی توانسته بودند درباره 5 سؤال از این 10 سؤال طرح‌شده، اطلاعات کاربردی دریافت کنند.

این سیستم جدید به‌رغم موفقیت‌های چشمگیر، به گفته‌ آنتروپیک همچنان نیازمند تلاش‌های مداوم برای مقابله با تکنیک‌های جیلبریک جدید خواهد بود. تیم آنتروپیک مطمئن است سیستمش به‌سرعت می‌تواند برای مقابله با حملات جدید و غیرمجاز به‌روز شود.

آزمایش عمومی این سیستم از ۴ فوریه تا ۱۰ فوریه (16 تا 22 بهمن) ادامه خواهد داشت و در این مدت، کاربران می‌توانند به این آزمایش دسترسی داشته باشند و تلاش کنند پاسخ این سؤالات را بگیرند.

این اقدام آنتروپیک گامی بزرگ در جهت بهبود امنیت و کاهش خطرات ناشی از استفاده نادرست از هوش مصنوعی محسوب می‌شود. ممکن است همچنان راه‌هایی برای دورزدن این سیستم وجود داشته باشد اما سازوکار جدید آنتروپیک به‌طور قابل توجهی تلاش‌ها را پیچیده‌تر کرده است.

اشتراک‌ها:

OpenAI از مدل‌های هوش مصنوعی استدلالی o3 و o4-mini رونمایی کرد

1 ساعت قبل

شرکت هواپیمایی در منطقه آزاد اروند راه‌اندازی شود| ضرورت برقراری پرواز دبی و استانبول

3 ساعت قبل

گرد و غبار دید افقی را در جاده های قشم کاهش داد

3 ساعت قبل

لایحه دائمی شدن همسان‌سازی حقوق بازنشستگان پس گرفته شد !

4 ساعت قبل

دستور فوری پزشکیان برای صدور احکام و پرداخت معوقات همسان سازی بازنشستگان

4 ساعت قبل

دلیل عدم پرداخت معوقات همسان سازی برای بازنشستگان اعلام شد

4 ساعت قبل

افزایش یارانه نقدی اولین گروه از مردم صراحتا قطعی شد

4 ساعت قبل

رانا پلاس 30 میلیون گران شد / پژو 207i اتوماتیک 30 میلیون ارزان +جدول قیمت

5 ساعت قبل

داوطلبان معلمی تست سلامت روان ندارند!

6 ساعت قبل

موج دوم بارش‌ها به شدت مناطق مختلف این استان را تحت تأثیر قرار خواهد داد

مدیرکل هواشناسی فارس گفت: ۲ سامانه بارشی قوی از دقایق ابتدایی روز دوشنبه و سه شنبه ۵ و ۶ آذرماه از سمت غرب و شمال غرب وارد استان می شود.

5 ماه قبل

نقاط ضعف و قوت پیشرانه‌های آمونیاکی

آمونیاک جزو شناخته‌شده‌ترین مواد شیمیایی در دنیاست. اگر در رشته کشاورزی مشغول به کار باشید احتمالا با این ماده آشنایی دارید چراکه حدود ۸۰درصد آمونیاک تولیدی به عنوان کود شیمیایی

6 ماه قبل

افتتاح ۳ طرح گردشگری در سفر رئیس‌جمهور به خوزستان

اهواز - مدیرکل میراث‌فرهنگی، گردشگری و صنایع‌دستی خوزستان اعلام کرد که در سفر رئیس‌جمهور و وزیر میراث‌فرهنگی به این استان، سه طرح تأسیسات گردشگری به بهره‌برداری خواهد رسید.

3 ماه قبل

فرماندار شمیرانات از مجموعه فرهنگی‌تاریخی نیاوران بازدید کرد

فرماندار شمیرانات به مناسبت ایام نوروز از موزه‌ها و نمایشگاه‌های مجموعه فرهنگی‌تاریخی نیاوران بازدید کرد.

3 هفته قبل

تاریخ ثبت‌نام حج عمره رمضان اعلام شد + جزئیات

معاون حج و عمره سازمان حج و زیارت از ثبت‌نام اعزام‌های عمره ماه مبارک رمضان و ایام پایانی سال خبر داد.

2 ماه قبل

نماینده کارگران:زندگی در تهران با حقوق زیر۳۰میلیون ممکن نیست

با نزدیک شدن به ماه های پایانی سال بحث دستمزد داغ است, در حالی که کارفرمایان تلاش دارند, افزایش مزد را به صورت محدود نگه دارند, نمایندگان کارگران معتقد هستند

3 ماه قبل

خبر خوش برای مستاجران | رویای خانه‌دار شدن نزدیک‌تر شد

بانک مرکزی با اعطای خط اعتباری ۷۴ هزار میلیارد تومانی به بانک مسکن، مسیر افزایش سقف تسهیلات خرید، ساخت، جعاله و ودیعه مسکن را هموار کرد. این تصمیم که در

3 هفته قبل

صادرات محصولات کشاورزی ۳۶ درصد در ۱۴۰۳ افزایش یافت

وزیر جهاد کشاورزی گفت: در سال جاری، میزان واردات از نظر حجمی ۶ درصد و از نظر ارزشی ۱۱ درصد کاهش داشته، درحالی‌که صادرات با رشد ۳۶ درصدی همراه بوده

4 هفته قبل

تشدید نظارت بر تغییر کاربری اراضی کشاورزی در نوروز

رئیس سازمان امور اراضی کشور با ارسال نامه‌ای به رؤسای سازمان جهاد کشاورزی سراسر کشور، خواستار اتخاذ تدابیر ویژه برای جلوگیری از تغییر کاربری‌های غیرمجاز اراضی کشاورزی در ایام تعطیلات

4 هفته قبل