AI & ML interests

Safe and aligned AI research. We research situational awareness, deception, and hidden reasoning in language models.

models 0

None public yet

datasets 0

None public yet