در این نسخه، متن را کوتاه و پاسخمحور نگه داشتم و جزئیات مهم مربوط به نحوه بازی GPT-6 Astra و هزینه آزمایش را هم اضافه کردم. اطلاعات مربوط به اجرای Portal با گزارشهای منتشرشده درباره این آزمایش تطبیق داده شده است.
GPT-6 Astra در یک آزمایش مستقل توانست بازی Portal را بدون کنترل مستقیم انسان تا پایان پیش ببرد؛ اتفاقی که نشان میدهد مدلهای هوش مصنوعی جدید در درک تصویر، برنامهریزی چندمرحلهای و کنترل نرمافزارها وارد مرحلهای متفاوت شدهاند. با این حال، این آزمایش برخلاف چیزی که ویدئوی کوتاه آن نشان میدهد، در چند ساعت تمام نشد و اجرای کامل آن تقریباً یک شبانهروز طول کشید.
در این آزمایش GPT-6 Astra از طریق ابزارهای متصل به بازی، تصاویر محیط و اطلاعات موقعیت بازیکن را دریافت میکرد و سپس برای حرکت بعدی تصمیم میگرفت. بازی هنگام پردازش مدل متوقف میشد و بعد از آماده شدن فرمانها دوباره ادامه پیدا میکرد.
GPT-6 Astra چگونه بازی Portal را تمام کرد؟
نحوه اجرای این آزمایش با بازی کردن معمولی تفاوت داشت. GPT-6 Astra مستقیماً مانند یک گیمر انسانی و به صورت پیوسته بازی نمیکرد. سیستم ابتدا وضعیت محیط را به مدل نشان میداد و مدل بر اساس تصویر و اطلاعات موقعیت بازیکن تصمیم میگرفت چه حرکاتی باید انجام شود.
برای اتصال مدل به بازی از MCP یا Model Context Protocol و یک ابزار سفارشی برای توقف و ادامه بازی استفاده شد. در نتیجه زمانی که مدل در حال تحلیل و برنامهریزی بود، Portal متوقف میشد و پس از ارسال مجموعه فرمانها دوباره اجرا میشد.
آیا GPT-6 Astra بازی Portal را در دو ساعت تمام کرد؟
خیر. ویدئوی منتشرشده حدود دو ساعت طول دارد اما بخش زیادی از زمان پردازش و توقف بازی در آن حذف شده است. اجرای کامل آزمایش با در نظر گرفتن زمانهایی که مدل در حال فکر کردن بود، حدود ۲۳ ساعت و ۴۳ دقیقه طول کشید.
در طول این فرایند ۳۳۳۶ فراخوانی ابزار انجام شد. به همین دلیل حرکات نمایش دادهشده در ویدئوی ویرایششده بسیار سریع به نظر میرسند و ممکن است این تصور ایجاد شود که مدل بازی را تقریباً به صورت آنی کنترل کرده است. در واقع بین بسیاری از حرکات، بازی متوقف بوده و مدل برای تصمیم بعدی زمان صرف میکرد.
این تفاوت مهم است زیرا توانایی انجام یک بازی به صورت خودکار با توانایی انجام همان بازی به صورت بلادرنگ یکسان نیست.
هزینه بازی کردن Portal با GPT-6 Astra چقدر بود؟
یکی از جالبترین بخشهای این آزمایش هزینه پردازش آن است. بر اساس میزان استفاده از API، هزینه محاسبهشده اجرای کامل آزمایش حدود ۵۷۱٫۱۸ دلار اعلام شد. با این حال، گزارشهای منتشرشده توضیح میدهند که این رقم الزاماً به معنی پرداخت مستقیم همین مبلغ برای همان آزمایش نیست و هزینه استفاده با اشتراک ۲۰۰ دلاری Codex Pro پوشش داده شده بود.
این رقم نشان میدهد اجرای یک عامل هوش مصنوعی برای مدت طولانی و با هزاران چرخه مشاهده، تصمیمگیری و اجرای فرمان میتواند بسیار پرهزینهتر از استفاده معمولی از یک مدل زبانی باشد.
آیا تمام کردن Portal یک بنچمارک هوش مصنوعی محسوب میشود؟
این آزمایش را نباید به عنوان یک بنچمارک استاندارد هوش مصنوعی در نظر گرفت. اجرای موفق بازی نشان میدهد GPT-6 Astra میتواند اطلاعات تصویری را دریافت کند، درباره محیط تصمیم بگیرد و مجموعهای از اقدامات را در یک بازی سهبعدی ادامه دهد اما نتیجه یک آزمایش منفرد لزوماً قابلیتهای مدل را در تمام بازیها یا محیطهای ناشناخته مشخص نمیکند.
از طرف دیگر Portal بازی شناختهشدهای است و مکانیکها و مراحل آن سالها در اینترنت مستند شدهاند. بنابراین بخشی از اطلاعات مورد نیاز برای حل مراحل ممکن است از دانش قبلی مدل ناشی شده باشد. به همین دلیل این آزمایش بیشتر یک نمایش عملی از توانایی یک عامل هوش مصنوعی در مشاهده، برنامهریزی و کنترل محیط است تا یک آزمون استاندارد برای سنجش هوش عمومی مصنوعی.
در مجموع، عبور GPT-6 Astra از تمام مراحل Portal نشان میدهد مدلهای زبانی چندوجهی میتوانند فراتر از پاسخ دادن به متن عمل کنند و با مشاهده محیط، تصمیمگیری و ارسال فرمان با نرمافزار تعامل داشته باشند. نکته مهم این است که این موفقیت با توقفهای مکرر بازی و هزینه پردازشی قابل توجه به دست آمده و هنوز نمیتوان آن را معادل بازی کردن یک انسان به صورت بلادرنگ دانست.
سادهگو