LLM エージェント時代のグラフエンジニアリング研究とプロジェクト集
本文の状態
日本語全文を表示中
詳細モードで約24分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
吉林大学 DEEP-JLU チームは、LLM エージェントの時代におけるグラフ工学を体系化した調査論文と GitHub リポジトリを発表し、個々の知能からシステム全体の知能への移行を推進する。
AI深層分析を開く2026年8月26日 22:13
AI深層分析
キーポイント
Graph Engineering の定義と役割
明示的かつ動的なグラフ構造が、タスクの整理、異種エージェントの調整、ランタイム状態の維持、システム進化の支援を行う技術として定義されている。
知能の進化段階の提示
調査は「モデル知能」から「個体知能」、そして最終的に「システム知能」へと至るプロセスを体系的に追跡している。
包括的なリソース集約
関連する研究論文、ベンチマーク、オープンソースプロジェクトが厳選されたコレクションとして GitHub リポジトリにまとめられている。
Graph Engineering の3段階の知能構造
モデル知能、個体知能、システム知能という3つの段階を経由し、単体のモデル能力から協調的なシステムレベルの知能へと発展する構造的な道筋を提供する。
LLM エージェント時代における調査とリソースの公開
2026年8月に「Graph Engineering in the Era of LLM Agents」に関する調査論文および関連するリソースコレクションがリリースされた。
重要な引用
Graph Engineering studies how explicit, dynamic, and evolving graph structures can organize tasks, coordinate heterogeneous agents, maintain runtime state, and support system evolution.
The collection follows the survey's progression from Model Intelligence, through Individual Intelligence, to System Intelligence.
Graph Engineering provides a structured path from standalone model capability to coordinated system-level intelligence
ontology engineering providing a shared semantic layer
編集コメントを表示
編集コメント
吉林大学 DEEP-JLU チームが主導するこの調査は、単なる技術の列挙を超え、エージェントシステムの設計思想そのものを「個体」から「システム」へと昇華させる重要な枠組みを提供している。実装リポジトリと論文がセットで公開されることで、理論と実践のギャップを埋める役割を果たすことが期待される。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
LLM エージェントの時代におけるグラフエンジニアリング:個々の知能からシステム知能へ
LLM エージェントの時代におけるグラフエンジニアリングに関する研究論文、ベンチマーク、オープンソースプロジェクトを厳選してまとめたコレクションです。本リポジトリは、調査論文『Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence』(https://arxiv.org/abs/2608.21156) に付随するもので、継続的に更新されていきます。
グラフエンジニアリングとは、明示的かつ動的に変化するグラフ構造が、タスクの整理や異種エージェント間の調整、ランタイム状態の維持、そしてシステムの進化をどのように支えるかを研究する分野です。本コレクションは、調査論文で示された「モデル知能」から「個体知能」、そして「システム知能」へと至る流れに沿って構成されています。
🤗 ご協力をお待ちしています。 見落としのあるリソースや関連する新着作品が見つかった場合は、Issue を立てるかプルリクエストを送ってください。
📃 この調査やリポジトリが役立った場合、ぜひ論文を引用してください。
@misc{feng2026graphengineeringerallm,
title={Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence},
author={Yuyuan Feng and Zhishang Xiang and Chaobin Yang and Qichao Ma and Zerui Chen and Yujing Zhang and Ke Huang and Chuanjie Wu and Zhaoxu Liu and Yili Wang and Xin He and Jiapu Wang and Zijin Hong and Hao Chen and Yuanchen Bei and Kun Wang and Shengyuan Chen and Ningyu Zhang and Enyan Dai and Linhao Luo and Qingyi Pan and Qi Wang and Wenqi Fan and Guangjing Wang and Na Zou and Yangqiu Song and Xin Wang and Zechao Li and Xia Hu and Qing Li and Xiao Huang and Zhihong Zhang and Jinsong Su and Qinggang Zhang and Yi Chang},
year={2026},
eprint={2608.21156},
archivePrefix={arXiv},
primaryClass={cs.IR},
url={https://arxiv.org/abs/2608.21156},
}🎉 ニュース
- [2026 年 8 月] 調査論文『Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence』(https://arxiv.org/abs/2608.21156) および関連するリソースコレクションを公開しました。
概要
グラフエンジニアリングは、スタンドアロンのモデル能力から協調的なシステムレベルの知能へと至る構造化された道筋を提供します。
「Model Intelligence」は、パラメータ化されたトレーニング、プロンプトエンジニアリング、コンテキストエンジニアリングを通じて、ファウンデーションモデルの機能を構築・適応させます。
「Individual Intelligence」は、単一のエージェントにツール、メモリ、スキル、ランタイムオーケストレーション、永続的な相互作用ループを備え付けます。
「System Intelligence」は、明示的なグラフ構造を通じてタスク、エージェント、ランタイム状態、システムの進化を組織化し、オントロジーエンジニアリングが共有セマンティック層を提供します。
*ファウンデーションモデルからグラフ・オントロジーエンジニアリングへと至るエンジニアリングパラダイムの進化。*
目次
エージェントの調整
状態管理
システム進化
オントロジーエンジニアリング
ベンチマーク、データセット、環境
モデル知能
個体知能
システム知能
オープンソースライブラリ
モデル知能
個体知能
システム知能
アプリケーション
ソフトウェアエンジニアリングとIT運用
科学発見と実験室自動化
ヘルスケアと臨床意思決定支援
エンタープライズワークフローとデジタル組織
汎用デジタルエージェントと個人向け自動化
社会・経済シミュレーション
引用
謝辞
関連する調査論文
- (arXiv 2024) グラフ検索拡張生成:調査論文 [[論文]](https://arxiv.org/abs/2408.08921)
主要な関連論文と調査レポート
- (arXiv 2026) エージェント・ハーネス工学:調査報告 [[論文]](https://openreview.net/forum?id=eONq7FdiHa)
- (TechRxiv 2026) 自己進化型エージェントの体系的な調査:モデル中心から環境駆動型の共進化へ [[論文]](https://www.techrxiv.org/doi/full/10.36227/techrxiv.177203250.05832634/v2) [[Google Scholar]](https://scholar.google.com/citations?view_op=view_citation&hl=zh-CN&user=YDgbj6cAAAAJ&citation_for_view=YDgbj6cAAAAJ:zYLM7Y9cAGgC)
- (arXiv 2025) グラフと AI エージェントの融合:分類、進展、そして今後の機会 [[論文]](https://arxiv.org/abs/2506.18019)
- (arXiv 2025) グラフ拡張型大規模言語モデルエージェント:現状と将来展望 [[論文]](https://arxiv.org/abs/2507.21407)
- (arXiv 2026) グラフ、大規模言語モデル、そしてエージェントの統合:推論と検索 [[論文]](https://arxiv.org/abs/2604.15951)
- (arXiv 2024) LLM エージェントの計画プロセスの理解:調査報告 [[論文]](https://arxiv.org/abs/2402.02716)
- (Paper 2025) エージェント・ワークフローに関する調査:現状と将来 [[論文]](https://arxiv.org/abs/2508.01186)
- (arXiv 2026) エージェント・ループから構造化グラフへ:LLM エージェント実行のためのスケジューラ理論的枠組み [[論文]](https://arxiv.org/abs/2604.11378)
- (Vicinagearth 2024) LLM ベースのマルチエージェントシステムに関する調査:ワークフロー、インフラストラクチャ、そして課題 [[論文]](https://link.springer.com/article/10.1007/s44336-024-00009-2)
Graph Engineering (GitHub リポジトリ)
- (Frontiers of Computer Science 2026) 自己言説を超えて:LLM ベースのマルチエージェントシステムに焦点を当てた通信調査 [[論文]](https://arxiv.org/abs/2502.14321)
- (arXiv 2026) グラフベースのエージェントメモリ:分類、技術、および応用 [[論文]](https://arxiv.org/abs/2602.05665)
- (TMLR 2026) 自己進化型エージェントの調査:人工超知能への道で、何を・いつ・どのように・どこを進化させるか [[論文]](https://arxiv.org/abs/2507.21046)
- (OpenReview Archive 2026) 経験の時代における自己改善型エージェント:自己からメタ進化への調査 [[論文]](https://openreview.net/forum?id=IUltZSgLMm)
- (arXiv 2025) マルチエージェント協働メカニズム:LLM の調査 [[論文]](https://arxiv.org/abs/2501.06322)
- (arXiv 2026) 個々の知能を超えて:LLM ベースのマルチエージェントシステムにおける協働、失敗の帰属、そして自己進化の調査 [[論文]](https://arxiv.org/abs/2605.14892)
📜 研究論文
*モデル、個体、システムの知能を跨ぐ包括的な分類体系。
モデルの知能
*プロンプト、コンテキスト、ハネス、ループエンジニアリングを通じて、モデルの知能から個体の知能へ。
事前学習
- (NeurIPS 2020) GPT-3 — 言語モデルは Few-Shot Learner である [[論文]](https://scholar.google.com/scholar?q=Language+Models+are+Few-Shot+Learners)
- (arXiv 2021) Gopher — 言語モデルのスケーリング:Gopher のトレーニングから得た手法、分析、洞察 [[論文]](https://arxiv.org/abs/2112.11446)
- (JMLR 2023) PaLM — PaLM: Pathways を用いた言語モデルのスケールアップ [[論文]](https://scholar.google.com/scholar?q=PaLM%3A+Scaling+Language+Modeling+with+Pathways)
- (arXiv 2023) LLaMA — LLaMA: オープンで効率的な基盤言語モデル [[論文]](https://arxiv.org/abs/2302.13971)
- (arXiv 2020) Scaling Laws — ニューラル言語モデルのスケーリング法則 [[論文]](https://arxiv.org/abs/2001.08361)
- (NeurIPS 2022) Chinchilla — 計算リソース最適化された大規模言語モデルのトレーニング [[論文]](https://scholar.google.com/scholar?q=Training+Compute-Optimal+Large+Language+Models)
- (JMLR 2022) Switch Transformer — Switch Transformers: シンプルで効率的なスパース性を用いた兆パラメータ規模へのスケーリング [[論文]](https://scholar.google.com/scholar?q=Switch+Transformers%3A+Scaling+to+Trillion+Parameter+Models+with+Simple+and+Efficient+Sparsity)
- (arXiv 2024) Mixtral — Mixtral of Experts [[論文]](https://arxiv.org/abs/2401.04088)
- (Paper 2024) DeepSeekMoE — DeepSeekMoE: Mixture-of-Experts 言語モデルにおける究極の専門化への道 [[論文]](https://scholar.google.com/scholar?q=DeepSeekMoE%3A+Towards+Ultimate+Expert+Specialization+in+Mixture-of-Experts+Language+Models)
- (arXiv 2024) Llama 3 — The Llama 3 Herd of Models [[論文]](https://arxiv.org/abs/2407.21783)
- (arXiv 2024) DeepSeek-V3 — DeepSeek-V3 Technical Report [[論文]](https://arxiv.org/abs/2412.19437)
事前学習データとモデルの主要研究
- (2022年論文) Deduplication — トレーニングデータの重複除去が言語モデルを向上させる [[Paper]](https://scholar.google.com/scholar?q=Deduplicating+Training+Data+Makes+Language+Models+Better)
- (NeurIPS 2024) FineWeb — スケールしたウェブから最良のテキストデータを選別する FineWeb データセット [[Paper]](https://scholar.google.com/scholar?q=The+FineWeb+Datasets%3A+Decanting+the+Web+for+the+Finest+Text+Data+at+Scale)
- (NeurIPS 2024) DataComp-LM — 次世代の言語モデル用トレーニングセットを求めて [[Paper]](https://scholar.google.com/scholar?q=DataComp-LM%3A+In+Search+of+the+Next+Generation+of+Training+Sets+for+Language+Models)
- (arXiv 2024) Qwen2.5 — Qwen2.5 技術レポート [[Paper]](https://arxiv.org/abs/2412.15115)
- (arXiv 2025) Qwen3 — Qwen3 技術レポート [[Paper]](https://arxiv.org/abs/2505.09388)
- (arXiv 2025) Kimi K2 — オープンなエージェント型知能を実現する Kimi K2 [[Paper]](https://arxiv.org/abs/2507.20534)
事後学習(Post-Training)
- (ICLR 2022) FLAN — 微調整された言語モデルはゼロショット学習者である [[Paper]](https://scholar.google.com/scholar?q=Finetuned+Language+Models+Are+Zero-Shot+Learners)
- (ICLR 2022) T0 — マルチタスクプロンプトトレーニングがゼロショットタスクの一般化を可能にする [[Paper]](https://scholar.google.com/scholar?q=Multitask+Prompted+Training+Enables+Zero-Shot+Task+Generalization)
・(NeurIPS 2022) InstructGPT — 人間フィードバックを用いて言語モデルに指示に従わせるトレーニング [[論文]](https://scholar.google.com/scholar?q=Training+Language+Models+to+Follow+Instructions+with+Human+Feedback)
・(ICML 2023) Flan Collection — 効果的なインストラクションチューニングのためのデータと手法を設計する [[論文]](https://scholar.google.com/scholar?q=The+Flan+Collection%3A+Designing+Data+and+Methods+for+Effective+Instruction+Tuning)
・(arXiv 2022) Constitutional AI — AI フィードバックによる有害性の排除 [[論文]](https://arxiv.org/abs/2212.08073)
・(arXiv 2023) RLAIF — RLAIF vs. RLHF: 人間フィードバックに代わる AI フィードバックによる強化学習の拡張 [[論文]](https://arxiv.org/abs/2309.00267)
・(NeurIPS 2023) DPO — 直接選好最適化:言語モデルは実は報酬モデルである [[論文]](https://scholar.google.com/scholar?q=Direct+Preference+Optimization%3A+Your+Language+Model+is+Secretly+a+Reward+Model)
・(arXiv 2024) Tulu 3 — オープンソース言語モデルのポストトレーニングにおける新 frontier の開拓 [[論文]](https://arxiv.org/abs/2411.15124)
・(arXiv 2024) DeepSeekMath — オープンソース言語モデルにおける数学的推論の限界突破 [[論文]](https://arxiv.org/abs/2402.03300)
- (Nature 2025) DeepSeek-R1 — DeepSeek-R1 は強化学習を通じて大規模言語モデルの推論能力を強化します [[Paper]](https://scholar.google.com/scholar?q=DeepSeek-R1+Incentivizes+Reasoning+in+LLMs+through+Reinforcement+Learning)
- (arXiv 2025) DAPO — DAPO は、大規模スケールで動作するオープンソースの LLM 強化学習システムです [[Paper]](https://arxiv.org/abs/2503.14476)
- (ICLR 2025) WebRL — WebRL は、自己進化型のオンラインカリキュラム強化学習を用いて LLM ウェブエージェントを訓練する手法です [[Paper]](https://scholar.google.com/scholar?q=WebRL%3A+Training+LLM+Web+Agents+via+Self-Evolving+Online+Curriculum+Reinforcement+Learning)
- (arXiv 2025) Search-R1 — Search-R1 は、強化学習によって LLM に推論と検索エンジンの活用を学習させる研究です [[Paper]](https://arxiv.org/abs/2503.09516)
- (arXiv 2025) ReTool — ReTool は、LLM における戦略的なツール使用のための強化学習手法です [[Paper]](https://arxiv.org/abs/2504.11536)
- (arXiv 2025) ToolRL — ToolRL は、「報酬こそがツール学習に必要なすべてである」という仮説に基づく研究です [[Paper]](https://arxiv.org/abs/2504.13958)
- (arXiv 2025) RAGEN — RAGEN は、多ターン強化学習を通じて LLM エージェントの自己進化を理解する手法です [[Paper]](https://arxiv.org/abs/2504.20073)
- (arXiv 2025) Agent-R1 — Agent-R1 は、エンドツーエンドの強化学習を用いて強力な LLM エージェントを訓練する研究です [[Paper]](https://arxiv.org/abs/2511.14460)
- (arXiv 2025) Agent Lightning — Agent Lightning は、強化学習を使ってあらゆる AI エージェントを訓練できる手法です [[Paper]](https://arxiv.org/abs/2508.03680)
Graph Engineering (GitHub リポジトリ)
- (arXiv 2026) DynaWeb — DynaWeb: Web エージェントのモデルベース強化学習 [[論文]](https://arxiv.org/abs/2601.22149)
プロンプトエンジニアリング
- (arXiv 2021) プロンプトプログラミング — 大規模言語モデルのためのプロンプトプログラミング:少数ショットのパラダイムを超えて [[論文]](https://arxiv.org/abs/2102.07350)
- (論文 2022) デモンストレーション — デモの役割を再考する:インコンテキスト学習が機能する要因とは何か? [[論文]](https://scholar.google.com/scholar?q=Rethinking+the+Role+of+Demonstrations%3A+What+Makes+In-Context+Learning+Work%3F)
- (論文 2022) インコンテキスト例 — GPT-3 にとって良いインコンテキスト例とは何か? [[論文]](https://scholar.google.com/scholar?q=What+Makes+Good+In-Context+Examples+for+GPT-3%3F)
- (NeurIPS 2022) 思考の連鎖 — Chain-of-Thought プロンプティングが大規模言語モデルにおける推論を引き出す [[論文]](https://scholar.google.com/scholar?q=Chain-of-Thought+Prompting+Elicits+Reasoning+in+Large+Language+Models)
- (ICLR 2023) 自己一貫性 — Chain of Thought Reasoning の精度を向上させる自己一貫性の手法 [[論文]](https://scholar.google.com/scholar?q=Self-Consistency+Improves+Chain+of+Thought+Reasoning+in+Language+Models)
- (ICLR 2023) 最小から最大 — Least-to-Most プロンプティングが複雑な推論を可能にする [[論文]](https://scholar.google.com/scholar?q=Least-to-Most+Prompting+Enables+Complex+Reasoning+in+Large+Language+Models)
NeurIPS 2023 で発表された「Tree of Thoughts」は、大規模言語モデルを用いた意図的な問題解決手法を提案しています。[[Paper]](https://scholar.google.com/scholar?q=Tree+of+Thoughts%3A+Deliberate+Problem+Solving+with+Large+Language+Models)
同く NeurIPS 2023 で発表された「Self-Refine」は、自己フィードバックを活用した反復的な改善プロセスを扱った研究です。[[Paper]](https://scholar.google.com/scholar?q=Self-Refine%3A+Iterative+Refinement+with+Self-Feedback)
AAAI 2024 で発表された「Graph of Thoughts」は、大規模言語モデルを用いて複雑な問題を解決するアプローチを提示しています。[[Paper]](https://scholar.google.com/scholar?q=Graph+of+Thoughts%3A+Solving+Elaborate+Problems+with+Large+Language+Models)
2020 年の論文「AutoPrompt」は、自動的に生成されたプロンプトによって言語モデルから知識を引き出す手法を提案しています。[[Paper]](https://scholar.google.com/scholar?q=AutoPrompt%3A+Eliciting+Knowledge+from+Language+Models+with+Automatically+Generated+Prompts)
ICLR 2023 で発表された「APE」は、大規模言語モデルが人間レベルのプロンプトエンジニアリング能力を持つことを示した研究です。[[Paper]](https://scholar.google.com/scholar?q=Large+Language+Models+Are+Human-Level+Prompt+Engineers)
ICLR 2024 で発表された「OPRO」は、大規模言語モデルを最適化器として活用する手法について論じています。[[Paper]](https://scholar.google.com/scholar?q=Large+Language+Models+as+Optimizers)
同じく ICLR 2024 で発表された「Promptbreeder」は、プロンプトの進化を通じて自己言及的な自己改善を実現する手法を提案しています。[[Paper]](https://scholar.google.com/scholar?q=Promptbreeder%3A+Self-Referential+Self-Improvement+via+Prompt+Evolution)
Graph Engineering (GitHub リポジトリ)
- (arXiv 2024) TextGrad — テキストによる自動「微分」 [[論文]](https://arxiv.org/abs/2406.07496)
コンテキストエンジニアリング
- (Paper 2020) DPR — オープンドメイン質問応答のための密なパスジ retrieval [[論文]](https://scholar.google.com/scholar?q=Dense+Passage+Retrieval+for+Open-Domain+Question+Answering)
- (NeurIPS 2020) RAG — 知識集約型 NLP タスクのための検索拡張生成 [[論文]](https://scholar.google.com/scholar?q=Retrieval-Augmented+Generation+for+Knowledge-Intensive+NLP+Tasks)
- (Paper 2021) FiD — オープンドメイン質問応答における生成モデルを活用したパスジ検索 [[論文]](https://scholar.google.com/scholar?q=Leveraging+Passage+Retrieval+with+Generative+Models+for+Open+Domain+Question+Answering)
- (Paper 2023) HyDE — 関連性ラベルなしで高精度なゼロショット密検索 [[論文]](https://scholar.google.com/scholar?q=Precise+Zero-Shot+Dense+Retrieval+without+Relevance+Labels)
- (Paper 2023) IRCoT — 知識集約型多段階質問への対応における検索と思考連鎖の交互実行 [[論文]](https://scholar.google.com/scholar?q=Interleaving+Retrieval+with+Chain-of-Thought+Reasoning+for+Knowledge-Intensive+Multi-Step+Questions)
- (ICLR 2024) Self-RAG — Self-RAG: 自己省察を通じて検索・生成・批判を学習する [[論文]](https://scholar.google.com/scholar?q=Self-RAG%3A+Learning+to+Retrieve%2C+Generate%2C+and+Critique+through+Self-Reflection)
- (NeurIPS 2025) CoRAG — Chain-of-Retrieval Augmented Generation [[論文]](https://scholar.google.com/scholar?q=Chain-of-Retrieval+Augmented+Generation)
- (NeurIPS 2024) RankRAG — RankRAG: LLM における文脈ランク付けと検索拡張生成を統合する手法 [[論文]](https://scholar.google.com/scholar?q=RankRAG%3A+Unifying+Context+Ranking+with+Retrieval-Augmented+Generation+in+LLMs)
- (Paper 2023) LLMLingua — LLMLingua: 大規模言語モデルの推論を加速するためのプロンプス圧縮 [[論文]](https://scholar.google.com/scholar?q=LLMLingua%3A+Compressing+Prompts+for+Accelerated+Inference+of+Large+Language+Models)
- (ICLR 2024) RECOMP — RECOMP: 圧縮と選択的拡張による検索拡張 LM の改善 [[論文]](https://scholar.google.com/scholar?q=RECOMP%3A+Improving+Retrieval-Augmented+LMs+with+Compression+and+Selective+Augmentation)
- (arXiv 2024) GraphRAG — ローカルからグローバルへ:クエリ指向要約のためのグラフ RAG アプローチ [[論文]](https://arxiv.org/abs/2404.16130)
Graph Engineering (GitHub リポジトリ)
- (ICLR 2025) Provence — Provence: 効率的かつ堅牢な文脈プルーニングによる検索拡張生成 [[論文]](https://scholar.google.com/scholar?q=Provence%3A+Efficient+and+Robust+Context+Pruning+for+Retrieval-Augmented+Generation)
- (2024 年論文) Lost in the Middle — Lost in the Middle: 言語モデルが長い文脈をどう利用するか [[論文]](https://scholar.google.com/scholar?q=Lost+in+the+Middle%3A+How+Language+Models+Use+Long+Contexts)
- (arXiv 2023) MemGPT — MemGPT: LLM を OS として実現する toward [[論文]](https://arxiv.org/abs/2310.08560)
- (arXiv 2024) HiAgent — HiAgent: 大規模言語モデルを用いた長期ホライズンエージェントタスクのための階層的作業メモリ管理 [[論文]](https://arxiv.org/abs/2408.09559)
- (ICML 2026) ACON — ACON: 長期ホライズン LLM エージェント向けの文脈圧縮最適化 [[論文]](https://arxiv.org/abs/2510.00615)
- (ICLR 2026) ACE — ACE: エージェンティック・コンテキストエンジニアリング。自己改善型言語モデルのための文脈の進化 [[論文]](https://arxiv.org/abs/2510.04618)
- (arXiv 2026) ContextCurator — ContextCurator: 強化学習による LLM エージェント向けの能動的な文脈キュレーションで、文脈のボトルネックを脱却する [[論文]](https://arxiv.org/abs/2604.11462)
- (arXiv 2026) AdaCoM — AdaCoM: 長期ホライズンタスクに適したエージェント対応の文脈管理手法の学習 [[論文]](https://arxiv.org/abs/2605.30785)
Individual Intelligence
Tool Integration
・(arXiv 2022) MRKL — MRKL Systems: 大規模言語モデル、外部知識源、離散推論を統合したモジュール型ニューロシンボリックアーキテクチャ [[論文]](https://arxiv.org/abs/2205.00445)
・(arXiv 2022) TALM — TALM: ツール拡張言語モデル [[論文]](https://arxiv.org/abs/2205.12255)
・(ICLR 2023) ReAct — ReAct: 言語モデルにおける推論と行動の相乗効果 [[論文]](https://openreview.net/forum?id=WE_vluYUL-X)
・(NeurIPS 2023) Toolformer — Toolformer: 言語モデルが自らツールの使い方を学ぶ [[論文]](https://scholar.google.com/scholar?q=Toolformer%3A+Language+Models+Can+Teach+Themselves+to+Use+Tools)
・(Paper 2023) API-Bank — API-Bank: ツール拡張型大規模言語モデルのための包括的ベンチマーク [[論文]](https://scholar.google.com/scholar?q=API-Bank%3A+A+Comprehensive+Benchmark+for+Tool-Augmented+LLMs)
・(ICLR 2024) ToolLLM — ToolLLM: 大規模言語モデルが 16,000 以上の実世界 API を習得するのを支援 [[論文]](https://scholar.google.com/scholar?q=ToolLLM%3A+Facilitating+Large+Language+Models+to+Master+16000%2B+Real-world+APIs)
・(NeurIPS 2024) Gorilla — Gorilla: 大規模言語モデルと膨大な API を接続 [[論文]](https://scholar.google.com/scholar?q=Gorilla%3A+Large+Language+Model+Connected+with+Massive+APIs)
・(Anthropic 2024) MCP — モデルコンテキストプロトコルの紹介 [[論文]](https://scholar.google.com/scholar?q=Introducing+the+Model+Context+Protocol)
2024 年 arXiv に掲載された「CodeAct」は、実行可能なコードアクションが LLM エージェントの性能を向上させることを示した研究です [[Paper]](https://arxiv.org/abs/2402.01030)。
同様に 2024 年 arXiv の「SWE-agent」は、エージェントとコンピュータのインターフェースが自動化されたソフトウェアエンジニアリングを可能にするという内容です [[Paper]](https://arxiv.org/abs/2405.15793)。
また、「OpenHands」も 2024 年 arXiv で発表され、一般化されたエージェントとして AI ソフトウェア開発者向けのオープンプラットフォームを提供します [[Paper]](https://arxiv.org/abs/2407.16741)。
2025 年の「ToolMaker」は、LLM エージェントがエージェント用のツールを作成する仕組みを提案しています [[Paper]](https://arxiv.org/abs/2502.11705)。
OpenAI が 2025 年に発表した「Codex」については、その紹介論文があります [[Paper]](https://scholar.google.com/scholar?q=Introducing+Codex)。
Anthropic の 2025 年発表「Claude Code」は、Claude 3.7 Sonnet と Claude Code の統合に関するものです [[Paper]](https://scholar.google.com/scholar?q=Claude+3.7+Sonnet+and+Claude+Code)。
Google が 2025 年に公開した「Gemini CLI」は、オープンソースの AI エージェントとして機能するコマンドラインツールです [[Paper]](https://scholar.google.com/scholar?q=Gemini+CLI%3A+Your+Open-Source+AI+Agent)。
GitHub Blog の 2025 年記事「Copilot Coding Agent」では、新しいコーディングエージェントとしての GitHub Copilot が紹介されています [[Paper]](https://scholar.google.com/scholar?q=GitHub+Copilot%3A+Meet+the+New+Coding+Agent)。
最後に、OpenAI Engineering の 2026 年発表「Symphony」は、Codex オーケストレーションのためのオープンソース仕様を定義しています [[Paper]](https://scholar.google.com/scholar?q=An+Open-Source+Spec+for+Codex+Orchestration%3A+Symphony)
Memory Management
主要な研究論文とプロジェクト
- (Paper 2023) Generative Agents — Generative Agents: Interactive Simulacra of Human Behavior [[Paper]](https://scholar.google.com/scholar?q=Generative+Agents%3A+Interactive+Simulacra+of+Human+Behavior)
- (AAAI 2024) MemoryBank — MemoryBank: Enhancing Large Language Models with Long-Term Memory [[Paper]](https://scholar.google.com/scholar?q=MemoryBank%3A+Enhancing+Large+Language+Models+with+Long-Term+Memory)
- (arXiv 2023) MemGPT — MemGPT: Towards LLMs as Operating Systems [[Paper]](https://arxiv.org/abs/2310.08560)
- (arXiv 2025) A-MEM — A-MEM: Agentic Memory for LLM Agents [[Paper]](https://arxiv.org/abs/2502.12110)
- (arXiv 2025) Mem0 — Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory [[Paper]](https://arxiv.org/abs/2504.19413)
- (arXiv 2025) Zep — Zep: A Temporal Knowledge Graph Architecture for Agent Memory [[Paper]](https://arxiv.org/abs/2501.13956)
- (arXiv 2025) MemoryOS — Memory OS of AI Agent [[Paper]](https://arxiv.org/abs/2506.06326)
- (arXiv 2025) Memoria — Memoria: A Scalable Agentic Memory Framework for Personalized Conversational AI [[Paper]](https://arxiv.org/abs/2512.12686)
- (Paper 2026) AgeMem — Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents [[Paper]](https://doi.org/10.18653/v1/2026.acl-long.981)
Graph Engineering (GitHub リポジトリ)
メモリ層の進化
- Memori(arXiv 2026):効率的で文脈を認識する LLM エージェントのための永続的メモリレイヤー。[[論文]](https://arxiv.org/abs/2603.19935)
- LycheeMemory V2(arXiv 2026):セマンティックなセグメントレベルでの統合を通じて、LLM エージェントが長期記憶を効率的に管理する方法。[[論文]](https://arxiv.org/abs/2608.12990)
- Agent Workflow Memory(arXiv 2024):エージェントのワークフローにおけるメモリ管理に関する研究。[[論文]](https://arxiv.org/abs/2409.07429)
スキルの構成と活用
- Voyager(arXiv 2023):大規模言語モデルを活用した、オープンエンドな具現化エージェント。[[論文]](https://arxiv.org/abs/2305.16291)
- CRAFT(ICLR 2024):専門的なツールセットを作成・検索することで LLM をカスタマイズする手法。[[論文]](https://scholar.google.com/scholar?q=CRAFT%3A+Customizing+LLMs+by+Creating+and+Retrieving+from+Specialized+Toolsets)
- Agent Skills(Anthropic Engineering 2025):実世界での運用に対応できるよう、エージェントにスキルを付与するアプローチ。[[論文]](https://scholar.google.com/scholar?q=Equipping+Agents+for+the+Real+World+with+Agent+Skills)
- SAGE(arXiv 2025):スキルライブラリを活用した強化学習による、自己改善型エージェントの構築。[[論文]](https://arxiv.org/abs/2512.17102)
- HASP(arXiv 2026):スキルプログラムを活用して LLM エージェントの能力を最大化する手法。[[論文]](https://arxiv.org/abs/2605.17734)
- SSL Skills(arXiv 2026):「スケジューリング・構造的・論理的」な表現を用いて、スキルテキストからスキルの構造へと変換する手法。[[論文]](https://arxiv.org/abs/2604.24026)
Graph Engineering (GitHub リポジトリ)
スキル関連の最新研究(2026 年 arXiv)
- SkillComposer — 仕様に従い、一般化能力を持つエージェントのスキルを学習して進化させる手法 [[論文]](https://arxiv.org/abs/2606.06079)
- Generative Skill Composition — LLM エージェント向けの生成型スキル合成技術 [[論文]](https://arxiv.org/abs/2606.32025)
- Skill-Use — LLM はアジェンシー・ハーネス内で実際にスキルを活用できるのか?という問いへの検証 [[論文]](https://arxiv.org/abs/2608.04828)
- HDSO — 仮説駆動型スキル最適化による LLM エージェントの性能向上 [[論文]](https://arxiv.org/abs/2606.22330)
- Demystifying Agent Skills — なぜエージェント・スキルは機能するのか、そしていつ失敗するのかを解明する研究 [[論文]](https://arxiv.org/abs/2608.14036)
ランタイム・オーケストレーション
- Long-Running Harness(Anthropic Engineering 2025) — 長時間稼働するエージェントを効果的に制御するためのハーネス設計 [[論文]](https://scholar.google.com/scholar?q=Effective+Harnesses+for+Long-Running+Agents)
- Externalization — LLM エージェントにおける外部化の統合レビュー:メモリ、スキル、プロトコル、そしてハーネス工学 [[論文]](https://arxiv.org/abs/2604.08224)
- Harness Engineering — 基盤モデルソフトウェア・エージェント向けのランタイム・サブストレートとしての AI ハーネス工学 [[論文]](https://arxiv.org/abs/2605.13357)
- Code as Agent Harness — コードをエージェントのハーネスとして活用するアプローチ [[論文]](https://arxiv.org/abs/2605.18747)
Graph Engineering (GitHub リポジトリ)
- (arXiv 2026) Harness Configuration — エージェント型 AI コーディングツールの設定に関する探索的調査 [[論文]](https://arxiv.org/abs/2602.14690)
- (arXiv 2026) Harness-Bench — リアルなエージェントワークフローにおけるモデル横断的なハルネス効果の測定 [[論文]](https://arxiv.org/abs/2605.27922)
- (arXiv 2026) Prompts to Contracts — プロンプトから契約へ:監査可能な企業向け LLM エージェントのためのハルネスエンジニアリング [[論文]](https://arxiv.org/abs/2607.08028)
- (arXiv 2024) ToolSandbox — LLM のツール利用能力を評価するための、状態保持型・対話型・インタラクティブなベンチマーク [[論文]](https://arxiv.org/abs/2408.04682)
- (arXiv 2023) ToolEmu — LM エミュレート型のサンドボックスを用いた、LM エージェントのリスク特定 [[論文]](https://arxiv.org/abs/2309.15817)
- (arXiv 2026) RHO — 暗闇で進化するエージェント:自己選好に基づく回顧的なハルネス最適化 [[論文]](https://arxiv.org/abs/2606.05922)
- (arXiv 2025) CaMeL — デザインによるプロンプトインジェクションの排除 [[論文]](https://arxiv.org/abs/2503.18813)
- (arXiv 2025) MCP Security Bench — MCP セキュリティベンチ(MSB):LLM エージェントにおけるモデルコンテキストプロトコルへの攻撃を評価するベンチマーク [[論文]](https://arxiv.org/abs/2510.15994)
- (OpenAI Engineering 2026) OpenAI Harness Engineering — ハルネスエンジニアリング:エージェントファーストな世界で Codex を活用する [[論文]](https://scholar.google.com/scholar?q=Harness+Engineering%3A+Leveraging+Codex+in+an+Agent-First+World)
Graph Engineering (GitHub リポジトリ)
- Anthropic Harness Design(Anthropic エンジニアリング 2026)— 長期実行アプリケーション開発向けのハーン設計 [[論文]](https://scholar.google.com/scholar?q=Harness+Design+for+Long-Running+Application+Development)
- Meta-Harness(arXiv 2026)— モデルハーンの包括的な最適化手法 [[論文]](https://arxiv.org/abs/2603.28052)
- Agentic Harness(arXiv 2026)— オブザーバビリティ駆動によるコーディングエージェント用ハーンの自動進化 [[論文]](https://arxiv.org/abs/2604.25850)
- Self-Harness(arXiv 2026)— 自己改善機能を備えたハーンシステム [[論文]](https://arxiv.org/abs/2606.09498)
- HarnessFix(arXiv 2026)— 失敗した実行軌道から信頼性の高い LLM エージェントへ:ハーンの欠陥診断と修復手法 [[論文]](https://arxiv.org/abs/2606.06324)
- HARBOR(arXiv 2026)— ハーン最適化の自動化システム [[論文]](https://arxiv.org/abs/2604.20938)
- AgentDojo(arXiv 2024)— LLM エージェント向けプロンプトインジェクション攻撃と防御策を評価するための動的環境 [[論文]](https://arxiv.org/abs/2406.13352)
- Harness Updating(arXiv 2026)— ハーン更新はハーンの恩恵ではない:自己進化型 LLM エージェントにおける進化能力の解明 [[論文]](https://arxiv.org/abs/2605.30621)
- Adaptive Auto-Harness(arXiv 2026)— オープンエンドなタスクリスト上でのエージェントシステム展開に向けた持続的な自己改善機能 [[論文]](https://arxiv.org/abs/2606.01770)
Graph Engineering (GitHub Repo)
- (arXiv 2026) LongHorizon-Harness — LongHorizon-Harness: 実世界タスクにおける長期ホライズンエージェントの進化 [[論文]](https://arxiv.org/abs/2608.01964)
- (arXiv 2026) OneDayAgent — OneDayAgent: 自律型エージェントのための長期ホライズン・ハルネス構築への道 [[論文]](https://arxiv.org/abs/2608.05013)
- (arXiv 2026) Evo-Harness — Evo-Harness: 自己進化型エージェントのための文脈からスキルをコンパイルするハルネス [[論文]](https://arxiv.org/abs/2608.15071)
- (arXiv 2026) Harness Handbook — Harness Handbook: 進化し続けるエージェント・ハルネスを読みやすく、探索可能に、編集可能にする [[論文]](https://arxiv.org/abs/2607.13285)
- (arXiv 2026) HarnessOpt-Bench — HarnessOpt-Bench: ハルネス最適化における大規模言語モデルの評価 [[論文]](https://arxiv.org/abs/2608.06301)
- (arXiv 2026) The Scaffold Effect — The Scaffold Effect in Coding Agents: コーディングエージェント評価におけるハルネス選択という隠れた変数 [[論文]](https://arxiv.org/abs/2607.22585)
- (arXiv 2026) Harness-IF — Harness-IF: コーディングエージェントにおける多様な指示インターフェースを跨ぐ命令従順性の評価 [[論文]](https://arxiv.org/abs/2608.11727)
- (arXiv 2026) Evo-Bench — Evo-Bench: 言語モデルはエージェント・ハルネスの改善が可能か?[[論文]](https://arxiv.org/abs/2608.09096)
Loop Architecture
- (arXiv 2024) StateFlow — StateFlow: ステート駆動型ワークフローによる LLM のタスク解決能力の向上 [[論文]](https://arxiv.org/abs/2403.11322)
主要なマルチエージェントシステムと研究
- (arXiv 2024) Magentic-One — 複雑なタスクを解決するための一般化されたマルチエージェントシステム [[論文]](https://arxiv.org/abs/2411.04468)
- (arXiv 2024) AIOS — LLM エージェント用オペレーティングシステム [[論文]](https://arxiv.org/abs/2403.16971)
- (arXiv 2024) AgentBoard — マルチターン LLM エージェントの分析評価プラットフォーム [[論文]](https://arxiv.org/abs/2401.13178)
- (arXiv 2023) AdaPlanner — 言語モデルによるフィードバックからの適応的プランニング [[論文]](https://arxiv.org/abs/2305.16653)
- (arXiv 2026) When Agents Do Not Stop — LLM エージェントにおける無限のループ現象を解明する研究 [[論文]](https://arxiv.org/abs/2607.01641)
- (arXiv 2026) Stop Hand-Holding Your Coding Agent — ステップバイステップのプロンプトに頼るのではなく、ループを設計してコーディングエージェントを自立させる [[論文]](https://arxiv.org/abs/2607.00038)
- (arXiv 2026) ResearchLoop — AI 支援研究のための証拠ベースの制御平面 [[論文]](https://arxiv.org/abs/2605.28282)
- (arXiv 2026) Proof-or-Stop — エージェントを信頼するのではなく、証拠を信頼せよ。検証可能な証拠に基づくライフサイクル制御のためのループエンジニアリング [[論文]](https://arxiv.org/abs/2607.14890)
インタラクションのパラダイム
- (arXiv 2026) Beyond Message Passing — エージェント通信プロトコルの意味論的視点:メッセージの受け渡しを超えて [[論文]](https://arxiv.org/abs/2604.02369)
- (2025 年論文)Internet of Agents — Internet of Agents: Fundamentals, Applications, and Challenges [[Paper]](https://arxiv.org/abs/2505.07176)
- (NeurIPS 2025)LACP — LLM Agent Communication Protocol (LACP) Requires Urgent Standardization: A Telecom-Inspired Protocol Is Necessary [[Paper]](https://arxiv.org/abs/2510.13821)
- (2026 年論文)Beyond the Protocol — Beyond the Protocol: Unveiling Attack Vectors in the Model Context Protocol (MCP) Ecosystem [[Paper]](https://doi.org/10.1109/TSE.2026.3694876)
- (arXiv 2026)AgentRx — AgentRx: Diagnosing AI Agent Failures from Execution Trajectories [[Paper]](https://arxiv.org/abs/2602.02475)
- (arXiv 2026)Supervising Ralph Wiggum — Supervising Ralph Wiggum: Exploring a Metacognitive Co-Regulation Agentic AI Loop for Engineering Design [[Paper]](https://arxiv.org/abs/2603.24768)
- (ZTE Communications 2025)From Function Calls to MCPs — From Function Calls to MCPs for Securing AI Agent Systems: Architecture, Challenges and Countermeasures [[Paper]](https://doi.org/10.12142/ZTECOM.202503004)
- (arXiv 2026)Sovereign Agentic Loops — Sovereign Agentic Loops: Decoupling AI Reasoning from Execution in Real-World Systems
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み