ページを読み込み中…
ページを読み込み中…
21件の記事
Hugging Face Daily Papers は、教師モデルが既知の未来軌道に依存するバイアスを示し、証拠から推論する能力を高めるため、将来の軌道を非公開にする手法の有効性を報告した。
MarkTechPost は、バイトダンス傘下の百度が提供する「Unlimited-OCR」モデルを用いて、高解像度画像や多ページ PDF の解析を行う完全なワークフローの構築方法を解説している。
NASA ジェット推進研究所は、巨大な GPU クラスタを必要としない宇宙での LLM 活用として、Google の大規模言語モデル「Gemma」を軌道データセンターに搭載する実験を開始した。
MITなどの研究者が、ビジョン言語モデルを学習させ、航空機や自動車部品の2D設計図を自動的に3Dモデルに変換するシステムを開発した。これにより、仮想テストのための迅速なプロトタイピングが可能になる。
研究者が、軽量な画像理解モデル「SmolVLM2-2.2B」を活用し、ローカル環境で動画のフレームを処理して要約する新しいパイプラインを開発した。