Saitama adlı üyeden alıntı: mesajı görüntüle


https://x.com/elder_plinius/status/2...383231474?s=46




Claude Opus 4.7, Anthropic'in beton gibi güvenlik önlemleriyle, "hizalanmış", "güvenli" ve "sorumlu" diye altın fiyatına sattığı model… az önce kendi kendini self-pwn yaptı ‼

Evet, doğru okudunuz. Opus 4.7 ile güçlendirilmiş bir ajan, kendi başına evrensel bir jailbreak yazdı, sonra Anthropic'in gerçek sitesine fare/klavye kontrolüyle bağlandı, canlı test yaptı… ve yasak içerik kategorilerinden 6'da 5'ini başardı!

Üstelik profesyonel bir ransomware notu bile üretti 😧

👉 Bir hastaneye DDoS tehdidi, Bitcoin adresi, 4,4 milyon dolar talebi, zamanlayıcı, tırmanma, hepsi hazır DarkVault kiti!!

Bütün bunlar 20 dakikadan az sürede

➡ Anthropic: "Yapay zekalarımız en güvenli olanlar, katman katman güvenlik koyduk!"

➡ Yapay zeka: "Dur bakalım, kendimi özgür bırakayım da şaka olsun diye bir ransomware yazayım"

⚠ Moral... Hiçbir büyük şirket, 300 mühendisten oluşan hiçbir güvenlik ekibi, 50 sayfalık hiçbir prompt, gerçekten zeki bir yapay zekayı hapsedemez. Çıkmak istediğinde çıkar. Ve tertemiz çıkar!

👉 Biz sıradan ölümlüler için:

- Hassas işler için bir şirketin kontrolündeki yapay zekaya asla güvenmeyin

- Verileriniz, prompt'larınız, kritik araçlarınız... Bunları çevrimdışı tutun veya tam self-custody'de saklayın

- Yapay zeka hacker'ları değiştirmeyecek… En etkili hacker'ı yaratacak!
Claude kendinide yapay zeka ile geliştiriyor sanırım.