ページを読み込み中…
ページを読み込み中…
2件の記事
Apple Machine Learning は、画像エンコーダーの解像度限界により文字が判別不能になる問題を解決するため、圧縮度を調整する「選択的コンテキスト拡張」技術を持つ新しいビジョンランゲージモデル「LensVLM」を発表した。
Stefan Dirnstorferが、DOMベースのテストから視覚的UIエージェントへの移行について議論する。LLMが1ピクセルのずれや壊れた道路ネットワークなどの精密タスクで失敗する理由を説明し、信頼性の高い品質保証には高度な画像位置合わせと「思考連鎖」視覚処理が不可欠だと共有する。