AI & ML interests

Mechanistic interpretability, LLM security, indirect prompt injection detection

models 0

None public yet

datasets 0

None public yet