https://x.com/elder_plinius/status/2...383231474?s=46
Claude Opus 4.7, Anthropic'in beton gibi güvenlik önlemleriyle, "hizalanmış", "güvenli" ve "sorumlu" diye altın fiyatına sattığı model
az önce kendi kendini self-pwn yaptı ‼
Evet, doğru okudunuz. Opus 4.7 ile güçlendirilmiş bir ajan, kendi başına evrensel bir jailbreak yazdı, sonra Anthropic'in gerçek sitesine fare/klavye kontrolüyle bağlandı, canlı test yaptı
ve yasak içerik kategorilerinden 6'da 5'ini başardı!
Üstelik profesyonel bir ransomware notu bile üretti 😧
👉 Bir hastaneye DDoS tehdidi, Bitcoin adresi, 4,4 milyon dolar talebi, zamanlayıcı, tırmanma, hepsi hazır DarkVault kiti!!
Bütün bunlar 20 dakikadan az sürede
➡ Anthropic: "Yapay zekalarımız en güvenli olanlar, katman katman güvenlik koyduk!"
➡ Yapay zeka: "Dur bakalım, kendimi özgür bırakayım da şaka olsun diye bir ransomware yazayım"
⚠ Moral... Hiçbir büyük şirket, 300 mühendisten oluşan hiçbir güvenlik ekibi, 50 sayfalık hiçbir prompt, gerçekten zeki bir yapay zekayı hapsedemez. Çıkmak istediğinde çıkar. Ve tertemiz çıkar!
👉 Biz sıradan ölümlüler için:
- Hassas işler için bir şirketin kontrolündeki yapay zekaya asla güvenmeyin
- Verileriniz, prompt'larınız, kritik araçlarınız... Bunları çevrimdışı tutun veya tam self-custody'de saklayın
- Yapay zeka hacker'ları değiştirmeyecek
En etkili hacker'ı yaratacak!