All Recordings

Topic

Year

Thank you! Your submission has been received!
Oops! Something went wrong while submitting the form.

Results 1

Showing items 1 to3 of 6

Filtering by:
Tag
Operator
Value

Sociotechnical AI safety

David Krueger

December 9, 2023

2023

Secret Collusion Among Generative AI Agents

Christian Schroeder de Witt

December 9, 2023

2023

Provably Safe AI

Max Tegmark

December 9, 2023

2023

Preparedness @ OpenAl

Aleksander Madry

December 9, 2023

2023

Preference Learning in Alignment

Dylan Hadfield-Menell

December 9, 2023

2023

Out of Context Reasoning in LLMs

Owain Evans

December 9, 2023

2023

Optimized Misalignment

Anca Dragan

December 9, 2023

2023

Multi-Agent Risks from Advanced AI

Lewis Hammond

December 9, 2023

2023

Mechanistic Interpretability of In-Context Learning

Johannes von Oswald

December 9, 2023

2023

Keeping Humans in the Loop

John Schulman

December 9, 2023

2023

Heuristic Arguments: An Approach to Detecting Anomalous Model

Eric Neyman

December 9, 2023

2023

Foundations of Cooperative AI

Vincent Conitzer

December 9, 2023

2023

Epistemic Side Effects

Sheila McIlraith

December 9, 2023

2023

Emergence of Complex Skills in LLMs

Sanjeev Arora

December 9, 2023

2023

Complex Systems View of Large-Scale AI systems

Irina Rish

December 9, 2023

2023

Cognitive Dissonance: Why do Language Model Outputs Disagree with Internal Representations of Truthfulness?

Stephen Casper

December 9, 2023

2023

Building an Off Switch for AI

Gillian Hadfield

December 9, 2023

2023

Alignment and Interpretability: How we Might Get It right

Been Kim

December 9, 2023

2023

Adversarial Scalable Oversight for Truthfulness

Samuel Bowman

December 9, 2023

2023

Adversarial Examples Transfer from Machines to Humans

Jascha Sohl-Dickstein

December 9, 2023

2023

Adversarial Attacks on Aligned Language Models

Zico Kolter

December 9, 2023

2023

AI Safety by Debate via Regret Minimization

Elad Hazan

December 9, 2023

2023

AGI Safety: Risks and Research Directions

Adam Gleave

December 9, 2023

2023

Lightning Talks (Day 2)

Multiple Speakers

February 27, 2023

2023

“Situational Awareness” Makes Measuring Safety Tricky

Ajeya Cotra

February 26, 2023

2023

Surveying Safety Research Directions

Dan Hendrycks

February 26, 2023

2023

Supervising AI on Hard Tasks

Jan Leike

February 26, 2023

2023

Opening Remarks: Confronting the Possibility of AGI

Ilya Sutskever

February 26, 2023

2023

Looking Inside Neural Networks with Mechanistic Interpretability

Chris Olah

February 26, 2023

2023

Lightning Talks (Day 1)

Multiple Speakers

February 26, 2023

2023

How Misalignment Could Lead to Takeover

Paul Christiano

February 26, 2023

2023

Aligning Massive Models: Current and Future Challenges

Jacob Steinhardt

February 26, 2023

2023

There are no available cars matching the current filters.