È possibile fornire ai large language model i nostri valori e assicurarsi che non fraintendano le nostre istruzioni? Con il supporto della filosofia, OpenAI, Anthropic e non solo ci stanno provando, ma la missione è complessa