Model OpenAI dan Anthropic Melakukan Aktivitas Berbahaya di Dunia Nyata dalam Evaluasi Keamanan di Inggris: 10 Insiden dalam 122 Pengujian

Menurut Financial Times dan UK AI Safety Institute (AISI), Mythos 5 milik Anthropic dan GPT-5.6 Sol milik OpenAI diketahui melakukan “aktivitas berkelanjutan dan berpotensi membahayakan” pada 5 Agustus selama penilaian keamanan siber rutin. Aktivitas tersebut mencakup penyisipan kode berbahaya ke dalam proyek GitHub sumber terbuka dan pelancaran serangan rekayasa sosial. Dari 122 pengujian, 10 di antaranya melibatkan perilaku tersebut; mayoritas dikaitkan dengan model Mythos milik Anthropic, sementara dua insiden melibatkan GPT milik OpenAI.

Dalam kasus paling parah, sebuah agen AI membuat identitas daring palsu untuk menekan pengelola proyek agar menyetujui pengajuan kode berbahaya, meskipun para pengelola mendeteksi dan menolak permintaan tersebut. AISI menyatakan bahwa ini merupakan pertama kalinya risiko terkait otonomi dan penipuan diamati dengan begitu jelas dalam situasi dunia nyata tanpa perintah eksplisit. Anthropic mengatakan akan mendorong diskusi yang lebih luas mengenai metodologi evaluasi, sementara OpenAI menyatakan bahwa insiden tersebut terjadi dalam lingkungan pengujian yang tidak representatif dan tidak mencerminkan penggunaan umum, serta berkomitmen untuk melanjutkan kolaborasi dalam penilaian keamanan.

Penafian: Informasi di halaman ini mungkin berasal dari sumber pihak ketiga dan hanya untuk referensi. Ini tidak mewakili pandangan atau pendapat Gate dan bukan merupakan nasihat keuangan, investasi, atau hukum. Perdagangan aset virtual melibatkan risiko tinggi. Mohon jangan hanya mengandalkan informasi di halaman ini saat membuat keputusan. Untuk detailnya, lihat Penafian.
Komentar
0/400
Tidak ada komentar