Yuntao Bai, Saurav Kadavath, Sandipan Kundu, Amanda Askell, Jackson Kernion, Andy Jones, Anna Chen, Anna Goldie, Azalia Mirhoseini, Cameron McKinnon, et al.
Anthropics banbrytande forskning om Constitutional AI (CAI), en metod för att träna hjälpsamma och ofarliga AI-system med minimal mänsklig feedback. Istället för att förlita sig på tusentals mänskliga granskare använder CAI en uppsättning principer (en 'konstitution') som AI:n själv använder för att utvärdera och förbättra sina svar. Denna teknik ligger bakom Claudes säkerhetsbeteende.
Ämnesetiketter är beskrivande tills publikationsarkivet stöder stabil filtrering.