OpenAI, yapay zekâ modellerinin ruh sağlığıyla ilgili gerçekçi konuşmalara verdiği yanıtları ölçmek için MentalHealthBench adlı açık değerlendirme sistemini yayımladı.
22 ülkeden 80’den fazla psikolog ve psikiyatristle geliştirilen sistem; güvenlik, bağlamı doğru anlama, kullanıcı özerkliğini koruma ve uygun yönlendirme gibi davranışları uzmanların hazırladığı ölçütlerle değerlendiriyor. OpenAI, çalışmanın yalnızca kriz senaryolarına değil günlük stres, ilişkiler ve daha ciddi ruh sağlığı durumlarına kadar geniş bir konuşma yelpazesine odaklandığını belirtiyor.