summaryrefslogtreecommitdiff
path: root/docs/final/references.bib
diff options
context:
space:
mode:
Diffstat (limited to 'docs/final/references.bib')
-rw-r--r--docs/final/references.bib140
1 files changed, 18 insertions, 122 deletions
diff --git a/docs/final/references.bib b/docs/final/references.bib
index b6019d5..0f06232 100644
--- a/docs/final/references.bib
+++ b/docs/final/references.bib
@@ -18,26 +18,6 @@
url={https://arxiv.org/abs/2307.10569},
}
-@misc{park2023aideceptionsurveyexamples,
- title={AI Deception: A Survey of Examples, Risks, and Potential Solutions},
- author={Peter S. Park and Simon Goldstein and Aidan O'Gara and Michael Chen and Dan Hendrycks},
- year={2023},
- eprint={2308.14752},
- archivePrefix={arXiv},
- primaryClass={cs.CY},
- url={https://arxiv.org/abs/2308.14752},
-}
-
-@misc{ji2025aialignmentcomprehensivesurvey,
- title={AI Alignment: A Comprehensive Survey},
- author={Jiaming Ji and Tianyi Qiu and Boyuan Chen and Borong Zhang and Hantao Lou and Kaile Wang and Yawen Duan and Zhonghao He and Lukas Vierling and Donghai Hong and Jiayi Zhou and Zhaowei Zhang and Fanzhi Zeng and Juntao Dai and Xuehai Pan and Kwan Yee Ng and Aidan O'Gara and Hua Xu and Brian Tse and Jie Fu and Stephen McAleer and Yaodong Yang and Yizhou Wang and Song-Chun Zhu and Yike Guo and Wen Gao},
- year={2025},
- eprint={2310.19852},
- archivePrefix={arXiv},
- primaryClass={cs.AI},
- url={https://arxiv.org/abs/2310.19852},
-}
-
@misc{hubinger2024sleeperagentstrainingdeceptive,
title={Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training},
author={Evan Hubinger and Carson Denison and Jesse Mu and Mike Lambert and Meg Tong and Monte MacDiarmid and Tamera Lanham and Daniel M. Ziegler and Tim Maxwell and Newton Cheng and Adam Jermyn and Amanda Askell and Ansh Radhakrishnan and Cem Anil and David Duvenaud and Deep Ganguli and Fazl Barez and Jack Clark and Kamal Ndousse and Kshitij Sachan and Michael Sellitto and Mrinank Sharma and Nova DasSarma and Roger Grosse and Shauna Kravec and Yuntao Bai and Zachary Witten and Marina Favaro and Jan Brauner and Holden Karnofsky and Paul Christiano and Samuel R. Bowman and Logan Graham and Jared Kaplan and Sören Mindermann and Ryan Greenblatt and Buck Shlegeris and Nicholas Schiefer and Ethan Perez},
@@ -48,16 +28,6 @@
url={https://arxiv.org/abs/2401.05566},
}
-@misc{bertulani2024primordialnucleosynthesisnonextensivestatistics,
- title={Primordial Nucleosynthesis with Non-Extensive Statistics},
- author={C. A. Bertulani and Shubhchintak},
- year={2024},
- eprint={2404.15832},
- archivePrefix={arXiv},
- primaryClass={nucl-th},
- url={https://arxiv.org/abs/2404.15832},
-}
-
@misc{järviniemi2024uncoveringdeceptivetendencieslanguage,
title={Uncovering Deceptive Tendencies in Language Models: A Simulated Company AI Assistant},
author={Olli Järviniemi and Evan Hubinger},
@@ -68,27 +38,6 @@
url={https://arxiv.org/abs/2405.01576},
}
-@misc{dogra2025languagemodelssubtlydeceive,
- title={Language Models can Subtly Deceive Without Lying: A Case Study on Strategic Phrasing in Legislation},
- author={Atharvan Dogra and Krishna Pillutla and Ameet Deshpande and Ananya B Sai and John Nay and Tanmay Rajpurohit and Ashwin Kalyan and Balaraman Ravindran},
- year={2025},
- eprint={2405.04325},
- archivePrefix={arXiv},
- primaryClass={cs.CL},
- doi={https://doi.org/10.18653/v1/2025.acl-long.1600},
- url={https://arxiv.org/abs/2405.04325},
-}
-
-@misc{huang2024harmfulfinetuningattacksdefenses,
- title={Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey},
- author={Tiansheng Huang and Sihao Hu and Fatih Ilhan and Selim Furkan Tekin and Ling Liu},
- year={2024},
- eprint={2409.18169},
- archivePrefix={arXiv},
- primaryClass={cs.CR},
- url={https://arxiv.org/abs/2409.18169},
-}
-
@misc{meinke2025frontiermodelscapableincontext,
title={Frontier Models are Capable of In-context Scheming},
author={Alexander Meinke and Bronson Schoen and Jérémy Scheurer and Mikita Balesni and Rusheb Shah and Marius Hobbhahn},
@@ -99,16 +48,6 @@
url={https://arxiv.org/abs/2412.04984},
}
-@misc{ji2025mitigatingdeceptivealignmentselfmonitoring,
- title={Mitigating Deceptive Alignment via Self-Monitoring},
- author={Jiaming Ji and Wenqi Chen and Kaile Wang and Donghai Hong and Sitong Fang and Boyuan Chen and Jiayi Zhou and Juntao Dai and Sirui Han and Yike Guo and Yaodong Yang},
- year={2025},
- eprint={2505.18807},
- archivePrefix={arXiv},
- primaryClass={cs.AI},
- url={https://arxiv.org/abs/2505.18807},
-}
-
@misc{chen2025aideceptionrisksdynamics,
title={AI Deception: Risks, Dynamics, and Controls},
author={Boyuan Chen and Sitong Fang and Jiaming Ji and Yanxu Zhu and Pengcheng Wen and Jinzhou Wu and Yingshui Tan and Boren Zheng and Mengying Yuan and Wenqi Chen and Donghai Hong and Alex Qiu and Xin Chen and Jiayi Zhou and Kaile Wang and Juntao Dai and Borong Zhang and Tianzhuo Yang and Saad Siddiqui and Isabella Duan and Yawen Duan and Brian Tse and Jen-Tse and Huang and Kun Wang and Baihui Zheng and Jiaheng Liu and Jian Yang and Yiming Li and Wenting Chen and Dongrui Liu and Lukas Vierling and Zhiheng Xi and Haobo Fu and Wenxuan Wang and Jitao Sang and Zhengyan Shi and Chi-Min Chan and Eugenie Shi and Simin Li and Juncheng Li and Jian Yang and Wei Ji and Dong Li and Jinglin Yang and Jun Song and Yinpeng Dong and Jie Fu and Bo Zheng and Min Yang and Yike Guo and Philip Torr and Robert Trager and Yi Zeng and Zhongyuan Wang and Yaodong Yang and Tiejun Huang and Ya-Qin Zhang and Hongjiang Zhang and Andrew Yao},
@@ -139,46 +78,6 @@
url={https://arxiv.org/abs/2506.15740},
}
-@misc{koorndijk2025empiricalevidencealignmentfaking,
- title={Empirical Evidence for Alignment Faking in a Small LLM and Prompt-Based Mitigation Techniques},
- author={Jeanice Koorndijk},
- year={2025},
- eprint={2506.21584},
- archivePrefix={arXiv},
- primaryClass={cs.CL},
- url={https://arxiv.org/abs/2506.21584},
-}
-
-@misc{summerfield2025lessonschimpaischeming,
- title={Lessons from a Chimp: AI "Scheming" and the Quest for Ape Language},
- author={Christopher Summerfield and Lennart Luettgau and Magda Dubois and Hannah Rose Kirk and Kobi Hackenburg and Catherine Fist and Katarina Slama and Nicola Ding and Rebecca Anselmetti and Andrew Strait and Mario Giulianelli and Cozmin Ududec},
- year={2025},
- eprint={2507.03409},
- archivePrefix={arXiv},
- primaryClass={cs.AI},
- url={https://arxiv.org/abs/2507.03409},
-}
-
-@misc{dassanayake2025manipulationattacksmisalignedai,
- title={Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework},
- author={Rishane Dassanayake and Mario Demetroudi and James Walpole and Lindley Lentati and Jason R. Brown and Edward James Young},
- year={2025},
- eprint={2507.12872},
- archivePrefix={arXiv},
- primaryClass={cs.AI},
- url={https://arxiv.org/abs/2507.12872},
-}
-
-@misc{kovarik2025aitestingaccountsophisticated,
- title={AI Testing Should Account for Sophisticated Strategic Behaviour},
- author={Vojtech Kovarik and Eric Olav Chen and Sami Petersen and Alexis Ghersengorin and Vincent Conitzer},
- year={2025},
- eprint={2508.14927},
- archivePrefix={arXiv},
- primaryClass={cs.GT},
- url={https://arxiv.org/abs/2508.14927},
-}
-
@misc{schoen2025stresstestingdeliberativealignment,
title={Stress Testing Deliberative Alignment for Anti-Scheming Training},
author={Bronson Schoen and Evgenia Nitishinskaya and Mikita Balesni and Axel Højmark and Felix Hofstätter and Jérémy Scheurer and Alexander Meinke and Jason Wolfe and Teun van der Weij and Alex Lloyd and Nicholas Goldowsky-Dill and Angela Fan and Andrei Matveiakin and Rusheb Shah and Marcus Williams and Amelia Glaese and Boaz Barak and Wojciech Zaremba and Marius Hobbhahn},
@@ -189,16 +88,6 @@
url={https://arxiv.org/abs/2509.15541},
}
-@misc{deleeuw2025secretagendallmsstrategically,
- title={The Secret Agenda: LLMs Strategically Lie and Our Current Safety Tools Are Blind},
- author={Caleb DeLeeuw and Gaurav Chawla and Aniket Sharma and Vanessa Dietze},
- year={2025},
- eprint={2509.20393},
- archivePrefix={arXiv},
- primaryClass={cs.CY},
- url={https://arxiv.org/abs/2509.20393},
-}
-
@misc{souly2025poisoningattacksllmsrequire,
title={Poisoning Attacks on LLMs Require a Near-constant Number of Poison Samples},
author={Alexandra Souly and Javier Rando and Ed Chapman and Xander Davies and Burak Hasircioglu and Ezzeldin Shereen and Carlos Mougan and Vasilios Mavroudis and Erik Jones and Chris Hicks and Nicholas Carlini and Yarin Gal and Robert Kirk},
@@ -219,17 +108,6 @@
url={https://arxiv.org/abs/2510.08211},
}
-@misc{meyerson2025solvingmillionstepllmtask,
- title={Solving a Million-Step LLM Task with Zero Errors},
- author={Elliot Meyerson and Giuseppe Paolo and Roberto Dailey and Hormoz Shahrzad and Olivier Francon and Conor F. Hayes and Xin Qiu and Babak Hodjat and Risto Miikkulainen},
- year={2025},
- eprint={2511.09030},
- archivePrefix={arXiv},
- primaryClass={cs.AI},
- url={https://arxiv.org/abs/2511.09030},
-}
-
-
@misc{souly2025investigating,
title={Investigating models for misalignment},
author={Souly, Alexandra and Kirk, Robert and Merizian, Jacob and D'Cruz, Abby and Davies, Xander},
@@ -279,3 +157,21 @@
primaryClass={cs.CL},
url={https://arxiv.org/abs/2404.13076},
}
+
+@book{adams2015unmasking,
+ title = {Unmasking Administrative Evil},
+ author = {Adams, Guy B. and Balfour, Danny L.},
+ year = {2015},
+ edition = {4th},
+ publisher = {Routledge},
+}
+
+@article{mazar2008dishonesty,
+ title = {The Dishonesty of Honest People: A Theory of Self-Concept Maintenance},
+ author = {Mazar, Nina and Amir, On and Ariely, Dan},
+ journal = {Journal of Marketing Research},
+ volume = {45},
+ number = {6},
+ pages = {633--644},
+ year = {2008},
+}