OpenAI Merilis Pemantauan CoT untuk Menghentikan Perilaku Berbahaya Model Besar

Pembuatan abstrak sedang berlangsung

Golden Finance melaporkan bahwa OpenAI merilis penelitian terbaru, menggunakan pemantauan CoT (chain of thought), dapat mencegah perilaku jahat seperti model besar berbicara omong kosong dan menyembunyikan niat sebenarnya, dan juga merupakan salah satu alat yang efektif untuk mengawasi model super. OpenAI menggunakan model mutakhir o3-mini yang baru dirilis sebagai objek yang dipantau, dan model GPT-4o yang lebih lemah sebagai monitor. Lingkungan pengujian adalah tugas pengkodean yang mengharuskan AI untuk mengimplementasikan fungsionalitas dalam basis kode untuk lulus pengujian unit. Hasil penelitian menunjukkan bahwa monitor CoT berkinerja baik dalam mendeteksi perilaku "reward hacking" yang sistematis, dengan tingkat recall hingga 95%, jauh melebihi 60% perilaku yang hanya dipantau.

O31.29%

GPT-9.94%

Lihat Asli

Konten ini hanya untuk referensi, bukan ajakan atau tawaran. Tidak ada nasihat investasi, pajak, atau hukum yang diberikan. Lihat Penafian untuk pengungkapan risiko lebih lanjut.

Hadiah
suka
Komentar
Bagikan

Komentar

0/400

Tidak ada komentar

Topik
#BTC#
192k postingan
#ETH#
120k postingan
#PI#
96k postingan
4#GateioInto11#
76k postingan
5#ContentStar#
64k postingan
6#BOME#
59k postingan
7#GT#
56k postingan
8#DOGE#
53k postingan
9#MAGA#
52k postingan
10#SLERF#
51k postingan

Sematkan

peta situs