AI Control: Improving Safety Despite Intentional Subversion AI Safety Fundamentals: Alignment podcast

Artwork

Tech Society Philosophy Blue Dot Impact

Kandungan disediakan oleh BlueDot Impact. Semua kandungan podcast termasuk episod, grafik dan perihalan podcast dimuat naik dan disediakan terus oleh BlueDot Impact atau rakan kongsi platform podcast mereka. Jika anda percaya seseorang menggunakan karya berhak cipta anda tanpa kebenaran anda, anda boleh mengikuti proses yang digariskan di sini https://ms.player.fm/legal.

AI Safety Fundamentals: Alignment « »
AI Control: Improving Safety Despite Intentional Subversion

7M ago 20:51

Kongsi

MP3•Laman utama episod

Kandungan disediakan oleh BlueDot Impact. Semua kandungan podcast termasuk episod, grafik dan perihalan podcast dimuat naik dan disediakan terus oleh BlueDot Impact atau rakan kongsi platform podcast mereka. Jika anda percaya seseorang menggunakan karya berhak cipta anda tanpa kebenaran anda, anda boleh mengikuti proses yang digariskan di sini https://ms.player.fm/legal.

We’ve released a paper, AI Control: Improving Safety Despite Intentional Subversion. This paper explores techniques that prevent AI catastrophes even if AI instances are colluding to subvert the safety techniques. In this post:

We summarize the paper;
We compare our methodology to the methodology of other safety papers.

Source:
https://www.alignmentforum.org/posts/d9FJHawgkiMSPjagR/ai-control-improving-safety-despite-intentional-subversion
Narrated for AI Safety Fundamentals by Perrin Walker

A podcast by BlueDot Impact.
Learn more on the AI Safety Fundamentals website.

… continue reading

Bab

1. AI Control: Improving Safety Despite Intentional Subversion (00:00:00)

2. Paper summary (00:02:41)

3. Setup (00:02:43)

4. Evaluation methodology (00:04:59)

5. Results (00:06:25)

6. Relationship to other work (00:10:51)

7. Future work (00:17:50)

83 episod

#Tech #Society #Philosophy #Blue Dot Impact

Artwork

AI Control: Improving Safety Despite Intentional Subversion

AI Safety Fundamentals: Alignment

published 7M ago

Kongsi

MP3•Laman utama episod

Kandungan disediakan oleh BlueDot Impact. Semua kandungan podcast termasuk episod, grafik dan perihalan podcast dimuat naik dan disediakan terus oleh BlueDot Impact atau rakan kongsi platform podcast mereka. Jika anda percaya seseorang menggunakan karya berhak cipta anda tanpa kebenaran anda, anda boleh mengikuti proses yang digariskan di sini https://ms.player.fm/legal.

We’ve released a paper, AI Control: Improving Safety Despite Intentional Subversion. This paper explores techniques that prevent AI catastrophes even if AI instances are colluding to subvert the safety techniques. In this post:

We summarize the paper;
We compare our methodology to the methodology of other safety papers.

Source:
https://www.alignmentforum.org/posts/d9FJHawgkiMSPjagR/ai-control-improving-safety-despite-intentional-subversion
Narrated for AI Safety Fundamentals by Perrin Walker

A podcast by BlueDot Impact.
Learn more on the AI Safety Fundamentals website.

… continue reading

Bab

1. AI Control: Improving Safety Despite Intentional Subversion (00:00:00)

2. Paper summary (00:02:41)

3. Setup (00:02:43)

4. Evaluation methodology (00:04:59)

5. Results (00:06:25)

6. Relationship to other work (00:10:51)

7. Future work (00:17:50)

83 episod

#Tech #Society #Philosophy #Blue Dot Impact

Semua episod

×

Selamat datang ke Player FM

Player FM mengimbas laman-laman web bagi podcast berkualiti tinggi untuk anda nikmati sekarang. Ia merupakan aplikasi podcast terbaik dan berfungsi untuk Android, iPhone, dan web. Daftar untuk melaraskan langganan merentasi peranti.

Dengarkan lebih 500+ topik

Panduan Rujukan Pantas

Podcast Teratas

Bantuan/Soalan Lazim | Naik taraf | Iklankan

Seni|Perniagaan|Komedi|Ekonomi|Hiburan|Berita|Politik|Agama

Sains|Bolasepak|Sukan|Bercerita|Teknologi|True Crime

Hak Cipta 2024 | Peta Laman | Dasar Privasi | Syarat Perkhidmatan | | hak cipta