Claudeの内部に「隠しホワイトボード」— Anthropicがモデル内部ワークスペースを発見、AI安全性研究の最前線
DRANK

9月20日、startuphub.aiが「Anthropic found a hidden whiteboard inside Claude」と題した記事を公開した。Anthropicのメカニスティック解釈可能性研究によってClaudeの内部に「隠しホワイトボード」とも言える内部ワークスペースが発見され、AIの意識や安全性をめぐる議論に新たな論点を提供している。

by @tf_official
Related Topics: AI Machine Learning Deep Learning