Scholay

学术搜索 · AI 审稿 · LaTeX 协作

OpenAI o1 System Card

作者:OpenAI, :, Aaron Jaech, Adam Tauman Kalai, Adam Lerer, Adam J. Richardson, Ahmed El-Kishky, A.M. Low, Alec Helyar, Aleksander Mądry, Alex Beutel, Alex Carney, Alex Iftimie, Alex Karpenko, Alex Tachard Passos, Alexander Neitz, Alexander Prokofiev, Alexander Wei, Allison Tam, Ally Bennett, Ananya Kumar, André Saraiva, Andrea Vallone, Andrew Duberstein, Andrew Kondrich, Mishchenko, Andrey, Andy Applebaum, Angela Jiang, Ashvin Nair, Barret Zoph, Behrooz Ghorbani, Zhang, Bohan, Ben Rossen, Benjamin Sokolowsky, Boaz Barak, Bob McGrew, Borys Minaiev, Botao Hao, Bowen Baker, Brandon Houghton, Brandon McKinzie, Brydon Eastman, Camillo Lugaresi, Bassin, Cary, Hudson, Cary, Chak Li, Charles de Bourcy, Chelsea Voss, Chen Shen, Chong Zhang, Christopher Koch, Chris Orsinger, Christopher Hesse, Fischer, Claudia, C.Y. Chan, Dan Roberts, Daniel Kappler, Daniel Lévy, Daniel Selsam, David Dohan, David Farhi, David Mely, David Robinson, Dimitris Tsipras, Doug Li, Oprica, Dragos, Freeman, Eben, Eddie Zhang, Edmund Wong, Proehl, Elizabeth, Cheung, Enoch, Eric Mitchell, Eric Wallace, E. Matthew Ritter, Evan Mays, Fan Wang, Felipe Petroski Such, Filippo Raso, Florencia Leoni, Foivos Tsimpourlas, Francis Song, Fred von Lohmann, Freddie Sulit, Geoff Salmon, Giambattista Parascandolo, Gildas Chabot, Grace Zhao, Greg Brockman, Guillaume Leclerc, Salman, Hadi, Bao, Haiming, Hao Sheng, Hart Andrin, Hessam Bagherinezhad, Hongyu Ren, Hunter Lightman, Hyung Won Chung, Ian Kivlichan, Ian O'Connell, Ian Osband, Ignasi Clavera Gilaberte, Ilge Akkaya, Ilya Kostrikov, Ilya Sutskever, Irina Kofman, Jakub Pachocki, James Lennon, Wei, Jason, Harb, Jean, Jerry Twore, Jiacheng Feng, Jiahui Yu, Jiayi Weng, Jie Tang, Yu, Jieqi, Joaquin Quiñonero Candela, Joe Palermo, J. G. Parish, Johannes Heidecke, John Hallman, John‐Ross Rizzo, J. Gordon, Jonathan Uesato, Jonathan M. Ward, Joost Huizinga, Julie Wang, Kai Chen, Kai Xiao, Singhal, Karan, Nguyen, Karina, Cobbe, Karl, Shi, Katy, Wood, Kayla, Kendra Rimbach, Keren Gu-Lemberg, Kevin Liu, Kevin Lu, Kevin Stone, Kevin Yu, Lama Ahmad, Yang, Lauren, Liu, Leo, Leon Maksin, Ling‐Jun Ho, Liam Fedus, Lilian Weng, Linden Li, Lindsay McCallum, Lindsey Held, Lorenz Kuhn, Lukas Kondraciuk, Łukasz Kaiser, Metz, Luke, Boyd, Madelaine, Maja Trębacz, Manas Joglekar, Mark Chen, Tintor, Marko, M. Meyer, Matthew W. Jones, Matt Kaufer, Max Schwarzer, Meghan Shah, Mehmet Yatbaz, Melody Y. Guan, Mengyuan Xu, Mengyuan Yan, Mia Glaese, Chen, Mianna, Lampe, Michael, M. Malek, Michele Wang, Michelle Fradin, Mike McClay, Mikhail Pavlov, Mingxuan Wang, Wang, Mingxuan, Mira Murati, Mo Bavarian, Mostafa Rohaninejad, McAleese, Nat, Chowdhury, Neil, Neil Chowdhury, Nick Ryder, Tezak, Nikolas, Brown, Noam, Ofir Nachum, Oleg Boiko, Oleg Murk, Watkins, Olivia, P.‐H. Grace Chao, Paul Ashbourne, Pavel Izmailov, Zhokhov, Peter, Dias, Rachel, Rahul K. Arora, Lin, Randall, R. M. C. Lopes, Raz Gaon, Reah Miyara, Leike, Reimar, Hwang, Renny, Rhythm Garg, Robin Brown, Rodney James, Rui Shu, Cheu, Ryan, Greene, Ryan, Jain, Saachi, S. Altman, Sam Toizer, Sam Toyer, Samuel Miserendino, Sandhini Agarwal, Hernandez, Santiago, Baker, Sasha, McKinney, Scott, Yan, Scottie, S. J. Zhao, Sheng-Li Hu, Shibani Santurkar, Shraman Ray Chaudhuri, Shuyuan Zhang, Siyuan Fu, Papay, Spencer, S. Z. Lin, Suchir Balaji, S. Sanjeev, Szymon Sidor, Tal Broda, Aidan Clark, Tao Wang, Gordon, Taylor, T. A. B. Sanders, Tejal Patwardhan, Thibault Sottiaux, Thomas Degry, Thomas Dimson, Tianhao Zheng, Timur Garipov, Tom Stasi, Trapit Bansal, Trevor Creech, T D Peterson, Tyna Eloundou, Valerie Qi, Kosaraju, Vineet, V. Monaco, Vitchyr Pong, Vlad Fomenko, Weiyi Zheng, Wenda Zhou, Zhan, Wenting, Wes McCabe, Wojciech Zaremba, Yann Dubois, Lu, Yinghai, Yining Chen, Y.-M. Cha, Yu Bai, Yangfan He, Yuchen Zhang, Yunyun Wang, Zheng Long Shao, Zhuohan Li · 发表于:arXiv (Cornell University) · 年份:2024 · DOI:10.48550/arxiv.2412.16720 · 被引用次数:41 · 研究领域:Advanced Computational Techniques and Applications

The o1 model series is trained with large-scale reinforcement learning to reason using chain of thought. These advanced reasoning capabilities provide new avenues for improving the safety and robustness of our models. In particular, our models can reason about our safety policies in context when responding to potentially unsafe prompts, through deliberative alignment. This leads to state-of-the-art performance on certain benchmarks for risks such as generating illicit advice, choosing stereotyped responses, and succumbing to known jailbreaks. Training models to incorporate a chain of thought before answering has the potential to unlock substantial benefits, while also increasing potential risks that stem from heightened intelligence. Our results underscore the need for building robust alignment methods, extensively stress-testing their efficacy, and maintaining meticulous risk management protocols. This report outlines the safety work carried out for the OpenAI o1 and OpenAI o1-mini models, including safety evaluations, external red teaming, and Preparedness Framework evaluations.