より良質なトレーニングデータを構築するエージェント(25 分読了)
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
TLDR AI は、AI モデルの学習効率を向上させるために、より高品質なトレーニングデータを作成・改善するための自律型エージェントの手法について解説している。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るSource Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
著者:Ilia Kulikov, Chenxi Whitehouse, Tianhao Wu, Yixin Nie, Swarnadeep Saha, Eryk Helenowski, Weizhe Yuan, Olga Golovneva, Jack Lanchantin, Yoram Bachrach, Jakob Foerster, Xian Li, Han Fang, Sainbayar Sukhbaatar, Jason Weston
**
要約:私たちは Autodata という一般的な手法を導入しました。これは AI エージェントをデータサイエンティストとして機能させ、高品質なトレーニングおよび評価データを構築させることを可能にします。そのようなデータサイエンティストエージェントを訓練(メタ最適化)する方法を示し、より強力なデータを生成する学習を実現します。全体の定式化と、具体的な実装である Agentic Self-Instruct について記述します。コンピュータサイエンス研究タスク、法的推論タスク、数学的対象を用いた推論タスクにおいて実験を行い、従来の合成データセット作成手法と比較して改善された結果を得ました。さらに、データサイエンティストエージェント自体をメタ最適化することで、より大きな性能向上をもたらすことが示されました。エージェントによるデータ作成は、推論計算リソースの増加を高品質なモデルトレーニングに変換する手段を提供します。全体的に、この方向性は AI データ構築の方法を変える可能性を秘めていると私たちは考えています。
対象分野:
Artificial Intelligence (cs.AI); Computation and Language (cs.CL); Machine Learning (cs.LG)
引用形式:
arXiv:2606.25996 [cs.AI]
(またはこのバージョンについては arXiv:2606.25996v2 [cs.AI])
**
https://doi.org/10.48550/arXiv.2606.25996
DataCite により発行された arXiv の DOI
## 提出履歴
From: Jason Weston [メールを表示]
[[v1]](https://arxiv.org/abs/2606.25996v1)**
2026 年 6 月 24 日 水曜日 16:08:31 UTC (19,889 KB)**
[v2]**
2026 年 6 月 25 日木曜日 13:26:50 UTC (19,879 KB)
原文を表示
Authors:Ilia Kulikov, Chenxi Whitehouse, Tianhao Wu, Yixin Nie, Swarnadeep Saha, Eryk Helenowski, Weizhe Yuan, Olga Golovneva, Jack Lanchantin, Yoram Bachrach, Jakob Foerster, Xian Li, Han Fang, Sainbayar Sukhbaatar, Jason Weston
Abstract:We introduce Autodata, a general method that enables AI agents to act as data scientists who build high quality training and evaluation data. We show how to train (meta-optimize) such a data scientist agent, so that it learns to create even stronger data. We describe the overall formulation, and a specific practical implementation, Agentic Self-Instruct. We conduct experiments on computer science research tasks, legal reasoning tasks and reasoning with mathematical objects, where we obtain improved results compared to classical synthetic dataset creation methods. Further, meta-optimizing the data scientist agent itself delivers an even larger performance uplift. Agentic data creation provides a way to convert increased inference compute into higher quality model training. Overall, we believe this direction has the potential to change the way we build AI data.
| Subjects: | Artificial Intelligence (cs.AI); Computation and Language (cs.CL); Machine Learning (cs.LG) |
|---|---|
| Cite as: | arXiv:2606.25996 [cs.AI] |
| (or arXiv:2606.25996v2 [cs.AI] for this version) | |
| https://doi.org/10.48550/arXiv.2606.25996 arXiv-issued DOI via DataCite |
Submission history
From: Jason Weston [view email] [[v1]](https://arxiv.org/abs/2606.25996v1)
Wed, 24 Jun 2026 16:08:31 UTC (19,889 KB)**
[v2]**
Thu, 25 Jun 2026 13:26:50 UTC (19,879 KB)
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み