Pinned
🚨 New preprint: Can Safety Emerge from Weak Supervision?
We study whether small LLMs can learn safer behavior without large human-annotated datasets. We introduce Self-MOA, an automated alignment framework.
📄 arxiv.org/pdf/2603.07017
Thread 👇



