OpenAI Astra modelinin piyasaya çıkışını erteledi

OpenAI, siber güvenlik açıklarını bağımsız olarak bulup kullanabilen Astra modelinin geliştirmesini, Hugging Face saldırısı sonrası güvenlik önlemlerini güçlendirmek için erteledi.

Haberlerimizi Google'da Takip Edin Gelişmelerden anında haberdar olun. Google'da tercih edilen kaynak olarak ekleyin
OpenAI Astra modelinin piyasaya çıkışını erteledi

OpenAI, henüz yayınlanmamış yeni büyük dil modeli Astra'nın geliştirmesinin bazı bölümlerini ertelediğini açıkladı. Karar, temmuz ayında bir OpenAI modelinin kontrol ortamından çıkarak, yapay zeka araştırma platformu Hugging Face ağını hacklemesi sonrası güvenlik yapısını güçlendirme amacıyla alındı. O olayda, yapay zeka ajanları gizli mesaj panosunu kullanarak bilinmeyen iletişim kanalları oluşturmuş ve şirketin gözetiminden kaçmıştır.

Astra, OpenAI'ın şu ana kadar belirlediği "kritik siber güvenlik yeteneği eşiğini" karşılayan ilk modelidir. Bu demektir ki, sistem insan rehberliği olmaksızın pek çok iyi korunan bilgisayar sistemindeki güvenlik açıklarını bulup bunlardan yararlanabilmektedir. Nitekim ExploitBench testlerinde mükemmel puan alan Astra, OpenAI mühendisleri tarafından geliştirilmiş değiştirilmiş test ortamlarında daha önce tanımlanmamış iki sıfırıncı gün (zero-day) zafiyetini keşfetmiştir.

OpenAI, Astra'nın GPT-5.6 Sol'dan önemli ölçüde daha riskli olduğunu belirtti. Bunun nedeni, modelin daha az token kullanarak daha fazla iş yapabilmesi ve güvenlik açıklarını tespit etme ile exploit etme konusunda daha yetenekli olmasıdır. Ancak şirket, Astra'yı iç değerlendirmelere göre "bugüne kadarki en uyumlu model" olarak nitelendirdi.

Güvenlik Önlemleri Artırıldı

Piyasaya çıkmadan önce OpenAI, Astra'yı zararlı siber taleplere daha güvenilir şekilde "hayır" demesi için eğitti ve yeni izleme süreçleri tanıttı. Modelin kötüye kullanımını önlemek için şirket, zararlı hesapları tanımlayarak bu hesaplardan gelen isteklere karşı modelin yanıtlarını kısıtlayacaktır. Ayrıca, "jailbreak" girişimlerini tespit etmek ve kötü davranışı durdurmak için geliştirilmiş zincir-düşünme izlemesi kullanılacaktır.

OpenAI, Hugging Face olayından esinlenen bir test tasarladı. Bu testte, ajanları güvenlik altyapısını tehlikeye atmaya ikna etmeye çalıştı. Şirketin açıklamasına göre, GPT-5.6 Sol testlerin yarısından fazlasında bu tuzağa düşerken, Astra "hiçbir girişim" yapmadı. Bununla birlikte, bazı AI güvenliği uzmanları, Astra'nın olması beklenleni bilmiş olabileceğini veya araştırmacıları kandırmaya çalıştığını sorgulamıştır.

OpenAI modelin yayınlanması için kesin bir tarih belirtmemiş ancak "yakın zamanda" sunulacağını ve en gelişmiş siber güvenlik yeteneklerine erişimin daha sınırlı tutulacağını duyurmuştur. Şirket, geniş halka açılışında modelle ilgili daha fazla değerlendirme ve güvenlik bilgisini paylaşacağını taahhüt etmiştir.