
2026/09/24 3:36
LensVLM:長文脈を画像として圧縮し、関連するページのみを拡大表示する
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
LensVLM は、選択的デコンプレッションを視覚言語ワークフローに統合することで、大規模ドキュメントデータの管理に変革をもたらす 9B(90 億パラメータ)の Vision-Language モデルです。高解像度の全ドキュメントを保存したり処理したりするのではなく、この専用モデルは圧縮されたテキスト画像をスキャンし、学習済みツールを用いて関連するページのみを知的にフル解像度まで拡張します。この機構は、視覚表現の圧縮問題を効果的に解決し、一律のデコンプレッションではなく特定のクエリニーズに基づいて動的に計算資源を管理します。システムは 5x から 15x の印象的な圧縮比率をサポートし(5x、10x、および 15x を含む)、ストレージ要件を大幅に削減しつつデータのアクセシビリティを維持します。Apple Modified Qwen アーキテクチャに基づいて構築された LensVLM はオープンソースであり、コードは Apple Sample Code License、モデルファイルは Apple Machine Learning Research Model License の下で入手可能です。ユーザーは GitHub リポジトリ(https://github.com/apple-aiml-research/ml-lensvlm)をクローンしてシステムをインストール・実行し、`python scripts/run_demo.py
またはdemo.py を実行することで推論またはカスタムドキュメントクエリを実行できます。モデル経路(apple/LensVLM-9B`)、テキストファイル、質問、圧縮レベルなどのオプションを指定します。追加のデータ準備および評価の詳細は、リポジトリの README に記載されています。この研究は Xie Roy、Dan Friedman、Donghan Yu、Bowen Pan、Christopher Fifty、Jang-Hyun Kim、Xianzhi Du、Zhe Gan、Vivek Rathod、Bhuwan Dhingra の氏により執筆され、論文は arXiv プリアプリント 2605.07019(2026 年にリスト)と識別されています。今後の開発では、利用可能なトレーニングデータに基づいてパフォーマンスを向上させるためのツール選択論理のさらなる最適化が予定されています。最終的に、LensVLM は効率的なストレージと高忠実度な検索のギャップを架橋し、ローカルで複雑なテキスト・イメージドキュメントを取り扱う方法に革命をもたらします。
Improved Summary:
レンズ VLM(LensVLM)は、90 億パラメータ規模の視覚言語モデルであり、大規模ドキュメントデータの管理に対して画期的なアプローチを導入するものです。これは、選択的デコンプレッションを視覚言語ワークフローに統合することで実現されています。高解像度のドキュメント全体を保存・処理するのではなく、この特殊化されたモデルは圧縮されたテキスト画像をスキャンし、学習されたツールを用いて関連するページのみをインテリジェントにフル解像度に戻すという方式を採用します。この機構は、視覚表現の圧縮問題に対して効果的に対処し、画一的なデコンプレッションではなく、特定のクエリニーズに基づいて動的に計算資源を管理します。システムは 5 倍から 15 倍(5 倍、10 倍、および 15 倍を含む)の圧縮比率をサポートし、ストレージ需要を大幅に削減しながらデータのアクセシビリティを維持します。Apple の Modified Qwen アーキテクチャを基礎として構築された LensVLM はオープンソースであり、コードは Apple Sample Code License、モデルファイルは Apple Machine Learning Research Model License の下で入手可能です。ユーザーは GitHub リポジトリ(https://github.com/apple-aiml-research/ml-lensvlm)をクローンしてシステムをインストールし実行でき、`python scripts/run_demo.py
またはdemo.py を実行することで推論またはカスタムドキュメントクエリを実行できます。モデルパス(apple/LensVLM-9B`)、テキストファイル、質問、圧縮レベルなどのオプションを指定します。追加のデータ準備および評価の詳細はリポジトリの README にあります。本研究は Xie Roy、Dan Friedman、Donghan Yu、Bowen Pan、Christopher Fifty、Jang-Hyun Kim、Xianzhi Du、Zhe Gan、Vivek Rathod、および Bhuwan Dhingra の氏により執筆され、論文は arXiv プリアプリント 2605.07019(2026 年にリスト)として識別されています。今後の発展では、利用可能なトレーニングデータに基づいてパフォーマンスを向上させるためのツール選択論理のさらなる最適化が約束されています。最終的に、LensVLM は効率的なストレージと高忠実度な検索のギャップを架橋し、ローカルで複雑なテキスト・イメージドキュメントを取り扱う方法に革命をもたらします。本文
LensVLM:圧縮画像による文脈の選択的拡張
概要
- LensVLM は、90 億パラメータ規模のビジョン・ランゲージモデル(VLM)です。
- テキストを圧縮した画像をスキャンし、学習済みツールを用いて必要なページのみを選択的に元の非圧縮形式に戻す機能を備えています。
リポジトリとライセンス情報
- 論文タイトル: LensVLM: Selective Context Expansion for Compressed Visual Representation of Text
- ソースコード: GitHub
- モデルファイルのライセンス: Apple Machine Learning Research Model License(Apple の Qwen モデルに対する改変を含む)
- ソースコードのライセンス: Apple Sample Code License
使用方法
インストールとデモ実行
LensVLM のコードをインストールし、推論を実行するには以下のコマンドを使用してください。
git clone https://github.com/apple-aiml-research/ml-lensvlm cd ml-lensvlm pip install -r requirements.txt python scripts/run_demo.py --model apple/LensVLM-9B
カスタム文書の処理
自社のドキュメントを処理するには、以下のパラメータを指定して実行します。
python demo.py \ --model apple/LensVLM-9B \ --text_file document.txt \ --question "What is the main finding?" \ --compression 10x
圧縮オプション
- 利用可能な圧縮倍率: 5 倍, 10 倍, 15 倍
- より詳細なデータ準備や評価方法は、リポジトリ内の
をご参照ください。README
引用情報
@article{xie2026lensvlm, title={LensVLM: Selective Context Expansion for Compressed Visual Representation of Text}, author={Xie, Roy and Friedman, Dan and Yu, Donghan and Pan, Bowen and Fifty, Christopher and Kim, Jang-Hyun and Du, Xianzhi and Gan, Zhe and Rathod, Vivek and Dhingra, Bhuwan}, journal={arXiv preprint arXiv:2605.07019}, year={2026} }