
요약
根據 Anthropic 最新研究,團隊分析 Claude Sonnet 4.5 的內部運作,發現大型語言模型內部存在一種可被量化的「情緒表徵」(emotion vectors),會在不同情境下被激活,進而影響模型的決策與回應。 簡單來說,AI 並不是單純「算答案」,而是會在不同「狀態」下做出不同選...
본문
AnthropicClaude Sonnet 4.5 emotion vectors AI AI AI calmdesperatereward hacking AI AI AI pretrainingpost-training 150 SourceAnthropic AI AI AI desperate AI AI Pixabay