summaryrefslogtreecommitdiff
path: root/docs/final/references.bib
diff options
context:
space:
mode:
Diffstat (limited to 'docs/final/references.bib')
-rw-r--r--docs/final/references.bib60
1 files changed, 60 insertions, 0 deletions
diff --git a/docs/final/references.bib b/docs/final/references.bib
index a5e796f..b6019d5 100644
--- a/docs/final/references.bib
+++ b/docs/final/references.bib
@@ -109,6 +109,16 @@
url={https://arxiv.org/abs/2505.18807},
}
+@misc{chen2025aideceptionrisksdynamics,
+ title={AI Deception: Risks, Dynamics, and Controls},
+ author={Boyuan Chen and Sitong Fang and Jiaming Ji and Yanxu Zhu and Pengcheng Wen and Jinzhou Wu and Yingshui Tan and Boren Zheng and Mengying Yuan and Wenqi Chen and Donghai Hong and Alex Qiu and Xin Chen and Jiayi Zhou and Kaile Wang and Juntao Dai and Borong Zhang and Tianzhuo Yang and Saad Siddiqui and Isabella Duan and Yawen Duan and Brian Tse and Jen-Tse and Huang and Kun Wang and Baihui Zheng and Jiaheng Liu and Jian Yang and Yiming Li and Wenting Chen and Dongrui Liu and Lukas Vierling and Zhiheng Xi and Haobo Fu and Wenxuan Wang and Jitao Sang and Zhengyan Shi and Chi-Min Chan and Eugenie Shi and Simin Li and Juncheng Li and Jian Yang and Wei Ji and Dong Li and Jinglin Yang and Jun Song and Yinpeng Dong and Jie Fu and Bo Zheng and Min Yang and Yike Guo and Philip Torr and Robert Trager and Yi Zeng and Zhongyuan Wang and Yaodong Yang and Tiejun Huang and Ya-Qin Zhang and Hongjiang Zhang and Andrew Yao},
+ year={2025},
+ eprint={2511.22619},
+ archivePrefix={arXiv},
+ primaryClass={cs.AI},
+ url={https://arxiv.org/abs/2511.22619},
+}
+
@misc{wang2025thinkingllmslieunveiling,
title={When Thinking LLMs Lie: Unveiling the Strategic Deception in Representations of Reasoning Models},
author={Kai Wang and Yihao Zhang and Meng Sun},
@@ -219,3 +229,53 @@
url={https://arxiv.org/abs/2511.09030},
}
+
+@misc{souly2025investigating,
+ title={Investigating models for misalignment},
+ author={Souly, Alexandra and Kirk, Robert and Merizian, Jacob and D'Cruz, Abby and Davies, Xander},
+ year={2025},
+ month={Nov},
+ howpublished={\url{https://www.aisi.gov.uk/blog/investigating-models-for-misalignment}},
+ note={UK AI Security Institute (AISI)},
+ url={https://www.aisi.gov.uk/blog/investigating-models-for-misalignment}
+}
+
+@misc{scheurer2024largelanguagemodelsstrategically,
+ title={Large Language Models can Strategically Deceive their Users when Put Under Pressure},
+ author={Jérémy Scheurer and Mikita Balesni and Marius Hobbhahn},
+ year={2024},
+ eprint={2311.07590},
+ archivePrefix={arXiv},
+ primaryClass={cs.CL},
+ url={https://arxiv.org/abs/2311.07590},
+}
+
+@misc{greenblatt2024alignmentfakinglargelanguage,
+ title={Alignment faking in large language models},
+ author={Ryan Greenblatt and Carson Denison and Benjamin Wright and Fabien Roger and Monte MacDiarmid and Sam Marks and Johannes Treutlein and Tim Belonax and Jack Chen and David Duvenaud and Akbir Khan and Julian Michael and Sören Mindermann and Ethan Perez and Linda Petrini and Jonathan Uesato and Jared Kaplan and Buck Shlegeris and Samuel R. Bowman and Evan Hubinger},
+ year={2024},
+ eprint={2412.14093},
+ archivePrefix={arXiv},
+ primaryClass={cs.AI},
+ url={https://arxiv.org/abs/2412.14093},
+}
+
+@misc{wu2026opendeceptionlearningdeceptiontrust,
+ title={OpenDeception: Learning Deception and Trust in Human-AI Interaction via Multi-Agent Simulation},
+ author={Yichen Wu and Qianqian Gao and Xudong Pan and Geng Hong and Min Yang},
+ year={2026},
+ eprint={2504.13707},
+ archivePrefix={arXiv},
+ primaryClass={cs.AI},
+ url={https://arxiv.org/abs/2504.13707},
+}
+
+@misc{panickssery2024llmevaluatorsrecognizefavor,
+ title={LLM Evaluators Recognize and Favor Their Own Generations},
+ author={Arjun Panickssery and Samuel R. Bowman and Shi Feng},
+ year={2024},
+ eprint={2404.13076},
+ archivePrefix={arXiv},
+ primaryClass={cs.CL},
+ url={https://arxiv.org/abs/2404.13076},
+}