Aikyam
Popular repositories Loading
-
llm-memorization
llm-memorization PublicUnderstanding the memorization property of Large Language Models using Model Attribution
Python 9
-
hallucinogen
hallucinogen PublicA benchmark for evaluating hallucinations in large visual language models
Python 8
Repositories
- multilingual-monitoring Public
We show that CoT monitoring is fragile under linguistic distribution shift. Across 13 languages and 16 frontier models, adversarial hints expose a 95.9% deception rate. This repo contains the code and resources for reproducing our findings.
-
-
- llm-memorization Public
Understanding the memorization property of Large Language Models using Model Attribution