Ramp Labs、タスク共有とモデル間 LoRA 適応フレームワーク「PorTAL」をオープンソース化
Ramp Labs は、汎用的なタスク潜在表現と軽量なベースモデル別アライメントにより、1回の学習で複数の凍結済み基盤モデルに LoRA を適用可能なフレームワーク「PorTAL」をオープンソース化した。
AI深層分析を開く2026年7月28日 23:20
AI深層分析
キーポイント
KV キャッシュ間通信による効率化
PorTAL は従来のトークン空間での文脈共有に代わり、ワーカーの注意パターンを利用してオーケストレーターのメモリから関連情報を抽出・破棄する KV キャッシュ間通信アルゴリズムを実装した。
既存手法の課題と対比
LLM 要約は遅く情報損失があり、RAG は文書間の関係性が失われやすく、フルコンテキストの共有はコストが高く精度を損なうという既存手法の限界を指摘している。
31% のトークン削減と精度維持
新手法によりエージェント間の関連メモリ共有が高速化され、結果として使用トークンを 31% 削減しながらも従来通りの精度を達成したことを発表している。
トークンスキップとKVキャッシュ操作
本手法はトークンを完全にスキップし、ワーカー自身の注意パターンを用いてオーケストレーターのメモリから関連情報を抽出して不要な部分を破棄する。
推論対応のためのアルゴリズム改変
自己アテンションではなくタスククエリによるスコアリング、全ヘッドにわたるグローバルマスク、適応圧縮のためのMAD正規化閾値処理を導入した。
重要な引用
Multi-agent systems are powerful, but can be wildly inefficient.
Our method skips tokens entirely. We operate on the KV cache...
Result: 31% fewer tokens used, same accuracy.
Our method skips tokens entirely.
編集コメントを表示
編集コメント
PorTAL が提案する KV キャッシュ間通信は、マルチエージェントシステムのスケーラビリティを高める画期的なアプローチである。技術的な実装の詳細は今後の動向に注目すべきだが、コスト削減と精度維持の両立が示された点は業界にとって大きな前進となる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
エージェントが関連する記憶を直接、迅速に共有するための手法「Latent Briefing」をご紹介します。この方法により、使用トークン数を 31% 削減しながらも、精度は維持されています。
マルチエージェントシステムは強力ですが、非効率になりがちです。コンテキストをトークンとして渡すため、コストが爆発的に増大し、重要な情報が失われやすくなります。そこで私たちは、エージェント間で KV キャッシュ同士で直接通信できるアルゴリズムを開発しました。

エージェントはコンテキストを共有する必要がありますが、トークン空間で行うことには明らかなトレードオフが存在します。
• LLM による要約:処理に時間がかかり(20〜60 秒)、情報が欠落しやすく、次のエージェントが本当に必要な情報を逃すことが多い
• RAG(検索拡張生成):コンテキストをチャンクに分割するため、文書間の関係性が失われる
• 完全なコンテキストの転送:コストが高くノイズが多く、精度を下げる要因にもなる
私たちの手法ではトークンを介さず、KV キャッシュ上で直接処理を行います。ワーカー自身のアテンションパターンを活用して、オーケストレータの記憶から必要な部分だけを抽出し、不要な部分を捨て去ります。

私たちは「Attention Matching(AM)」と呼ばれる KV キャッシュ圧縮フレームワークを応用しました。この AM アルゴリズムは、補正項を通じてアテンション出力を維持しながら、KV キャッシュ(C1, β, C2)を圧縮します。
さらに、推論環境で即座に使用できるようアルゴリズムを改良しました:
- ワーカーのタスククエリに基づいてスコアトークンを計算し、自己注意機構に依存しない
- すべてのヘッドにわたるグローバルマスクを採用することで、大規模なバッチ処理を可能にする
- MAD 正規化を用いた閾値処理により、適応的な圧縮を実現する
結果として、320 の連続した解決タスクが 2〜3 回のバッチ演算に集約され、速度は最大 20 倍向上。中央値では 1.7 秒で完了します。
原文を表示
Introducing Latent Briefing, a way for agents to quickly share their relevant memory directly. Result: 31% fewer tokens used, same accuracy.
Multi-agent systems are powerful, but can be wildly inefficient. They pass context as tokens, so costs explode and signal gets lost. We built an algorithm that allows agents to communicate KV cache to KV cache.

Agents need to share context, but doing it in token space has real tradeoffs:
• LLM summaries: slow (20–60s), lossy, and often miss what the next agent actually needs
Discover more
Philosophy
X platform guide
Biological Sciences
Charity & Philanthropy
Jewish people
Brand
Tweet scheduling service
Religion & Belief
• RAG: splits context into chunks, so relationships across documents get lost
• Passing full context: expensive, noisy, and often hurts accuracy
Our method skips tokens entirely. We operate on the KV cache, using the worker's own attention patterns to extract what's relevant from the orchestrator's memory and discard the rest.

We adapted the Attention Matching (AM) KV cache compaction framework. The AM algorithm compacts the KV cache (C1, β, C2) preserving attention outputs through a correction term.
We modified the algorithm to make it inference ready:
- Score tokens using the worker's task query, not self attention
- Global mask across all heads → enables massive batching
- MAD-normalized thresholding for adaptive compression
Result: 320 sequential solves → 2-3 batched ops. 20x speedup to a median of 1.7 s.
AI算出
主要ニュースainew評価高い
AI エージェントの非効率性を解決する画期的な KV キャッシュ直接通信手法であり、独自の実験データ(31% トークン削減、20 倍速度向上)を伴う新技術発表であるため novelty は高く評価される。ただし、日本企業や日本語特有の文脈での言及がないため japan_relevance は低めとなる。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 50
- 新規性
- 75
- 調べる価値
- 75
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み