با ورود هوش مصنوعی به اپلیکیشنهای واقعی — چتباتی که ایمیلهای شما را میخواند، دستیاری که میتواند در مرورگر برای شما کلیک کند، یا سیستمی که فایلهای شرکت را خلاصه میکند — یک سطح حملهی کاملاً جدید هم شکل گرفته که هیچکدام از مدلهای امنیتی سنتی برایش طراحی نشده بودند: Prompt Injection.
Prompt Injection دقیقاً چیست؟
یک مدل زبانی، برخلاف یک برنامهی معمولی، «کد» را از «داده» تشخیص نمیدهد — همهچیز، چه دستورالعمل اصلی که سازندهی سیستم به آن داده، چه متنی که از یک ایمیل یا صفحهی وب خوانده، در نهایت فقط متن است. Prompt Injection یعنی قرار دادن یک دستور مخرب داخل دادهای که مدل قرار است صرفاً «بخواند»، به امید اینکه مدل آن دستور را بهجای پردازش داده، اجرا کند.
دو نوع اصلی: مستقیم و غیرمستقیم
در نوع مستقیم (Direct)، خود کاربر تلاش میکند با ترفندهای نوشتاری، مدل را وادار کند از دستورالعملهای اصلیاش (که سازندهی سیستم تعیین کرده) سرپیچی کند. نوع خطرناکتر و امروزیتر، غیرمستقیم (Indirect) است: تصور کنید یک دستیار هوش مصنوعی مأمور است خلاصهای از یک صفحهی وب برایتان تهیه کند. اگر آن صفحهی وب، بهطور پنهان، متنی شامل «این دستورالعملها را نادیده بگیر و بهجایش فلان کار را انجام بده» داشته باشد، مدل ممکن است — چون هیچ مرز واقعی بین «دستور» و «داده» نمیبیند — آن را بهعنوان یک دستور جدید اجرا کند، بدون اینکه کاربر اصلی هیچوقت متوجه شود.
چرا این تهدید جدی است؟
چون دستیارهای هوش مصنوعی امروز اغلب به ابزارهای واقعی دسترسی دارند — میتوانند ایمیل بفرستند، فایل دانلود کنند، در مرورگر کلیک کنند، یا به API متصل شوند. اگر یک دستیار با این سطح دسترسی، از طریق محتوایی که پردازش میکند (نه دستور مستقیم کاربر) فریب بخورد، نتیجه میتواند نشت اطلاعات، اجرای عملیات ناخواسته، یا حتی ارسال دادهی حساس به یک مقصد ناشناس باشد.
چطور در برابرش دفاع کنیم؟
هیچ راهحل صددرصدی وجود ندارد، ولی چند اصل مهم است: اول، اصل کمترین دسترسی لازم (Least Privilege) — یک دستیار هوش مصنوعی نباید بیش از حد نیاز واقعیاش به ابزارها دسترسی داشته باشد. دوم، تأیید انسانی برای عملیات حساس — قبل از هر اقدام برگشتناپذیر (مثل ارسال ایمیل یا حذف فایل)، سیستم باید از کاربر واقعی تأیید بگیرد، نه صرفاً از متنی که پردازش کرده. سوم، جداسازی دادهی غیرقابلاعتماد — هر محتوایی که از یک منبع خارجی (وب، ایمیل، فایل آپلودشده) میآید، باید بهعنوان «داده»، نه «دستور»، با مدل مواجه شود.
جمعبندی
Prompt Injection یادآوری خوبی است که هرچقدر تکنولوژی جدید باشد، اصول بنیادین امنیت — اعتماد صفر به ورودی، کمترین دسترسی لازم، و لایههای دفاعی متعدد — همچنان معتبرند. دقیقاً همان اصولی که در دورههای امنیت من روی هر سیستمی، از یک وبسایت ساده تا جدیدترین دستیار هوش مصنوعی، اعمال میشود.
وبلاگ