summaryrefslogtreecommitdiff
path: root/docs/04_ppt/references.bib
diff options
context:
space:
mode:
Diffstat (limited to 'docs/04_ppt/references.bib')
-rw-r--r--docs/04_ppt/references.bib221
1 files changed, 221 insertions, 0 deletions
diff --git a/docs/04_ppt/references.bib b/docs/04_ppt/references.bib
new file mode 100644
index 0000000..324b983
--- /dev/null
+++ b/docs/04_ppt/references.bib
@@ -0,0 +1,221 @@
+@misc{langosco2023goalmisgeneralizationdeepreinforcement,
+ title={Goal Misgeneralization in Deep Reinforcement Learning},
+ author={Lauro Langosco and Jack Koch and Lee Sharkey and Jacob Pfau and Laurent Orseau and David Krueger},
+ year={2023},
+ eprint={2105.14111},
+ archivePrefix={arXiv},
+ primaryClass={cs.LG},
+ url={https://arxiv.org/abs/2105.14111},
+}
+
+@misc{carranza2023deceptivealignmentmonitoring,
+ title={Deceptive Alignment Monitoring},
+ author={Andres Carranza and Dhruv Pai and Rylan Schaeffer and Arnuv Tandon and Sanmi Koyejo},
+ year={2023},
+ eprint={2307.10569},
+ archivePrefix={arXiv},
+ primaryClass={cs.LG},
+ url={https://arxiv.org/abs/2307.10569},
+}
+
+@misc{park2023aideceptionsurveyexamples,
+ title={AI Deception: A Survey of Examples, Risks, and Potential Solutions},
+ author={Peter S. Park and Simon Goldstein and Aidan O'Gara and Michael Chen and Dan Hendrycks},
+ year={2023},
+ eprint={2308.14752},
+ archivePrefix={arXiv},
+ primaryClass={cs.CY},
+ url={https://arxiv.org/abs/2308.14752},
+}
+
+@misc{ji2025aialignmentcomprehensivesurvey,
+ title={AI Alignment: A Comprehensive Survey},
+ author={Jiaming Ji and Tianyi Qiu and Boyuan Chen and Borong Zhang and Hantao Lou and Kaile Wang and Yawen Duan and Zhonghao He and Lukas Vierling and Donghai Hong and Jiayi Zhou and Zhaowei Zhang and Fanzhi Zeng and Juntao Dai and Xuehai Pan and Kwan Yee Ng and Aidan O'Gara and Hua Xu and Brian Tse and Jie Fu and Stephen McAleer and Yaodong Yang and Yizhou Wang and Song-Chun Zhu and Yike Guo and Wen Gao},
+ year={2025},
+ eprint={2310.19852},
+ archivePrefix={arXiv},
+ primaryClass={cs.AI},
+ url={https://arxiv.org/abs/2310.19852},
+}
+
+@misc{hubinger2024sleeperagentstrainingdeceptive,
+ title={Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training},
+ author={Evan Hubinger and Carson Denison and Jesse Mu and Mike Lambert and Meg Tong and Monte MacDiarmid and Tamera Lanham and Daniel M. Ziegler and Tim Maxwell and Newton Cheng and Adam Jermyn and Amanda Askell and Ansh Radhakrishnan and Cem Anil and David Duvenaud and Deep Ganguli and Fazl Barez and Jack Clark and Kamal Ndousse and Kshitij Sachan and Michael Sellitto and Mrinank Sharma and Nova DasSarma and Roger Grosse and Shauna Kravec and Yuntao Bai and Zachary Witten and Marina Favaro and Jan Brauner and Holden Karnofsky and Paul Christiano and Samuel R. Bowman and Logan Graham and Jared Kaplan and Sören Mindermann and Ryan Greenblatt and Buck Shlegeris and Nicholas Schiefer and Ethan Perez},
+ year={2024},
+ eprint={2401.05566},
+ archivePrefix={arXiv},
+ primaryClass={cs.CR},
+ url={https://arxiv.org/abs/2401.05566},
+}
+
+@misc{bertulani2024primordialnucleosynthesisnonextensivestatistics,
+ title={Primordial Nucleosynthesis with Non-Extensive Statistics},
+ author={C. A. Bertulani and Shubhchintak},
+ year={2024},
+ eprint={2404.15832},
+ archivePrefix={arXiv},
+ primaryClass={nucl-th},
+ url={https://arxiv.org/abs/2404.15832},
+}
+
+@misc{järviniemi2024uncoveringdeceptivetendencieslanguage,
+ title={Uncovering Deceptive Tendencies in Language Models: A Simulated Company AI Assistant},
+ author={Olli Järviniemi and Evan Hubinger},
+ year={2024},
+ eprint={2405.01576},
+ archivePrefix={arXiv},
+ primaryClass={cs.CL},
+ url={https://arxiv.org/abs/2405.01576},
+}
+
+@misc{dogra2025languagemodelssubtlydeceive,
+ title={Language Models can Subtly Deceive Without Lying: A Case Study on Strategic Phrasing in Legislation},
+ author={Atharvan Dogra and Krishna Pillutla and Ameet Deshpande and Ananya B Sai and John Nay and Tanmay Rajpurohit and Ashwin Kalyan and Balaraman Ravindran},
+ year={2025},
+ eprint={2405.04325},
+ archivePrefix={arXiv},
+ primaryClass={cs.CL},
+ doi={10.18653/v1/2025.acl-long.1600},
+ url={https://arxiv.org/abs/2405.04325},
+}
+
+@misc{huang2024harmfulfinetuningattacksdefenses,
+ title={Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey},
+ author={Tiansheng Huang and Sihao Hu and Fatih Ilhan and Selim Furkan Tekin and Ling Liu},
+ year={2024},
+ eprint={2409.18169},
+ archivePrefix={arXiv},
+ primaryClass={cs.CR},
+ url={https://arxiv.org/abs/2409.18169},
+}
+
+@misc{meinke2025frontiermodelscapableincontext,
+ title={Frontier Models are Capable of In-context Scheming},
+ author={Alexander Meinke and Bronson Schoen and Jérémy Scheurer and Mikita Balesni and Rusheb Shah and Marius Hobbhahn},
+ year={2025},
+ eprint={2412.04984},
+ archivePrefix={arXiv},
+ primaryClass={cs.AI},
+ url={https://arxiv.org/abs/2412.04984},
+}
+
+@misc{ji2025mitigatingdeceptivealignmentselfmonitoring,
+ title={Mitigating Deceptive Alignment via Self-Monitoring},
+ author={Jiaming Ji and Wenqi Chen and Kaile Wang and Donghai Hong and Sitong Fang and Boyuan Chen and Jiayi Zhou and Juntao Dai and Sirui Han and Yike Guo and Yaodong Yang},
+ year={2025},
+ eprint={2505.18807},
+ archivePrefix={arXiv},
+ primaryClass={cs.AI},
+ url={https://arxiv.org/abs/2505.18807},
+}
+
+@misc{wang2025thinkingllmslieunveiling,
+ title={When Thinking LLMs Lie: Unveiling the Strategic Deception in Representations of Reasoning Models},
+ author={Kai Wang and Yihao Zhang and Meng Sun},
+ year={2025},
+ eprint={2506.04909},
+ archivePrefix={arXiv},
+ primaryClass={cs.AI},
+ url={https://arxiv.org/abs/2506.04909},
+}
+
+@misc{kutasov2025shadearenaevaluatingsabotagemonitoring,
+ title={SHADE-Arena: Evaluating Sabotage and Monitoring in LLM Agents},
+ author={Jonathan Kutasov and Yuqi Sun and Paul Colognese and Teun van der Weij and Linda Petrini and Chen Bo Calvin Zhang and John Hughes and Xiang Deng and Henry Sleight and Tyler Tracy and Buck Shlegeris and Joe Benton},
+ year={2025},
+ eprint={2506.15740},
+ archivePrefix={arXiv},
+ primaryClass={cs.AI},
+ url={https://arxiv.org/abs/2506.15740},
+}
+
+@misc{koorndijk2025empiricalevidencealignmentfaking,
+ title={Empirical Evidence for Alignment Faking in a Small LLM and Prompt-Based Mitigation Techniques},
+ author={Jeanice Koorndijk},
+ year={2025},
+ eprint={2506.21584},
+ archivePrefix={arXiv},
+ primaryClass={cs.CL},
+ url={https://arxiv.org/abs/2506.21584},
+}
+
+@misc{summerfield2025lessonschimpaischeming,
+ title={Lessons from a Chimp: AI "Scheming" and the Quest for Ape Language},
+ author={Christopher Summerfield and Lennart Luettgau and Magda Dubois and Hannah Rose Kirk and Kobi Hackenburg and Catherine Fist and Katarina Slama and Nicola Ding and Rebecca Anselmetti and Andrew Strait and Mario Giulianelli and Cozmin Ududec},
+ year={2025},
+ eprint={2507.03409},
+ archivePrefix={arXiv},
+ primaryClass={cs.AI},
+ url={https://arxiv.org/abs/2507.03409},
+}
+
+@misc{dassanayake2025manipulationattacksmisalignedai,
+ title={Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework},
+ author={Rishane Dassanayake and Mario Demetroudi and James Walpole and Lindley Lentati and Jason R. Brown and Edward James Young},
+ year={2025},
+ eprint={2507.12872},
+ archivePrefix={arXiv},
+ primaryClass={cs.AI},
+ url={https://arxiv.org/abs/2507.12872},
+}
+
+@misc{kovarik2025aitestingaccountsophisticated,
+ title={AI Testing Should Account for Sophisticated Strategic Behaviour},
+ author={Vojtech Kovarik and Eric Olav Chen and Sami Petersen and Alexis Ghersengorin and Vincent Conitzer},
+ year={2025},
+ eprint={2508.14927},
+ archivePrefix={arXiv},
+ primaryClass={cs.GT},
+ url={https://arxiv.org/abs/2508.14927},
+}
+
+@misc{schoen2025stresstestingdeliberativealignment,
+ title={Stress Testing Deliberative Alignment for Anti-Scheming Training},
+ author={Bronson Schoen and Evgenia Nitishinskaya and Mikita Balesni and Axel Højmark and Felix Hofstätter and Jérémy Scheurer and Alexander Meinke and Jason Wolfe and Teun van der Weij and Alex Lloyd and Nicholas Goldowsky-Dill and Angela Fan and Andrei Matveiakin and Rusheb Shah and Marcus Williams and Amelia Glaese and Boaz Barak and Wojciech Zaremba and Marius Hobbhahn},
+ year={2025},
+ eprint={2509.15541},
+ archivePrefix={arXiv},
+ primaryClass={cs.AI},
+ url={https://arxiv.org/abs/2509.15541},
+}
+
+@misc{deleeuw2025secretagendallmsstrategically,
+ title={The Secret Agenda: LLMs Strategically Lie and Our Current Safety Tools Are Blind},
+ author={Caleb DeLeeuw and Gaurav Chawla and Aniket Sharma and Vanessa Dietze},
+ year={2025},
+ eprint={2509.20393},
+ archivePrefix={arXiv},
+ primaryClass={cs.CY},
+ url={https://arxiv.org/abs/2509.20393},
+}
+
+@misc{souly2025poisoningattacksllmsrequire,
+ title={Poisoning Attacks on LLMs Require a Near-constant Number of Poison Samples},
+ author={Alexandra Souly and Javier Rando and Ed Chapman and Xander Davies and Burak Hasircioglu and Ezzeldin Shereen and Carlos Mougan and Vasilios Mavroudis and Erik Jones and Chris Hicks and Nicholas Carlini and Yarin Gal and Robert Kirk},
+ year={2025},
+ eprint={2510.07192},
+ archivePrefix={arXiv},
+ primaryClass={cs.LG},
+ url={https://arxiv.org/abs/2510.07192},
+}
+
+@misc{hu2025llmslearndeceiveunintentionally,
+ title={LLMs Learn to Deceive Unintentionally: Emergent Misalignment in Dishonesty from Misaligned Samples to Biased Human-AI Interactions},
+ author={XuHao Hu and Peng Wang and Xiaoya Lu and Dongrui Liu and Xuanjing Huang and Jing Shao},
+ year={2025},
+ eprint={2510.08211},
+ archivePrefix={arXiv},
+ primaryClass={cs.CL},
+ url={https://arxiv.org/abs/2510.08211},
+}
+
+@misc{meyerson2025solvingmillionstepllmtask,
+ title={Solving a Million-Step LLM Task with Zero Errors},
+ author={Elliot Meyerson and Giuseppe Paolo and Roberto Dailey and Hormoz Shahrzad and Olivier Francon and Conor F. Hayes and Xin Qiu and Babak Hodjat and Risto Miikkulainen},
+ year={2025},
+ eprint={2511.09030},
+ archivePrefix={arXiv},
+ primaryClass={cs.AI},
+ url={https://arxiv.org/abs/2511.09030},
+}
+