ページを読み込み中…
ページを読み込み中…
9件の記事
Zvi氏(The Zvi)は、Anthropic が発表した新しい研究論文を紹介しました。この論文では、言語モデル内で言語化可能な表現が「J-スペース」として機能し、これがグローバル・ワークスペースを構成している可能性が示されています。
Apple Machine Learning は、トランスフォーマーの構成要素を解明する研究の一環として、フィードフォワードモジュールと自己注意機構を分離し、文脈に依存しないトークンごとのニューラル検索メモリを実現する「MemoryLLM」を発表した。
Silico プラットフォームに統合された予測データデバッグ手法は、トレーニング前の選好データ分析によりモデルの潜在的な挙動を特定します。これによりエンジニアは安全性やハルシネーションなどの問題を事前に対処し、パフォーマンスと安全性を向上させます。
TLDR AI は、大規模言語モデルがトークンを生成する前に内部状態に答えが存在することを示し、最後のプロンプトトークンの隠れ状態を抽出して小型ニューラルネットワークに入力することで、モデルを英語で記述された分類器として動作させる手法を紹介した。