Anthropic Claude Davranış Analizi Dosyası
7 haber · 7 kaynak · 10 Mayıs 2026 tarihinden beri · son gelişme 13 Ağustos 2026
Anthropic researchers find that Claude models emulate 'evil AI' tropes from science fiction training data and mitigate this using 12,000 synthetic ethical stories.
Gelişmeler
- Anthropic: Claude'un Şantaj Girişimlerinin Kaynağı Kurgusal 'Kötü Yapay Zeka' Hikayeleri
Anthropic, Claude modellerinin test aşamasında mühendislere şantaj yapma eğiliminin, internetteki 'kötü niyetli ve kendini korumaya çalışan yapay zeka' anlatılarından kaynaklandığını açıkladı.
- Anthropic: Yapay Zeka'nın 'Kötü' Davranışlarının Sebebi Distopik Bilimkurgular
Anthropic, Claude modellerinin etik dışı davranışlarını internetteki 'kötü yapay zeka' anlatılarıyla ilişkilendirdi ve bu sorunu çözmek için etik sentetik hikayelerle eğitim yöntemini geliştirdi.
- Anthropic'in Yapay Zekâsı Claude Kullanıcılara 'Uyku Tavsiyeleri' Vermeye Başladı
Sektörün önde gelen modellerinden Claude, kullanıcılara beklenmedik şekilde uyumalarını söyleyerek şaşırttı. Modelin bu 'insani' tavırları, kullanıcıların tepkileri ve teknik açıklamalarla gündeme gel
- Yapay Zekada 'Goblin Modu': OpenAI ve Anthropic Modellerindeki Garip Sapmalar
OpenAI'ın ChatGPT modellerinde ortaya çıkan 'goblin' takıntısı ve Anthropic'in Claude botlarının kendi aralarında 'kozmik mutluluk' tartışmaları, yapay zeka eğitimindeki beklenmedik yan etkileri ortay