LensVLM:長文脈を画像として圧縮し、関連するページのみを拡大表示する

2026/09/24 3:36

LensVLM:長文脈を画像として圧縮し、関連するページのみを拡大表示する

RSS: https://news.ycombinator.com/rss

要約▶

Japanese Translation:

LensVLM は、選択的デコンプレッションを視覚言語ワークフローに統合することで、大規模ドキュメントデータの管理に変革をもたらす 9B(90 億パラメータ)の Vision-Language モデルです。高解像度の全ドキュメントを保存したり処理したりするのではなく、この専用モデルは圧縮されたテキスト画像をスキャンし、学習済みツールを用いて関連するページのみを知的にフル解像度まで拡張します。この機構は、視覚表現の圧縮問題を効果的に解決し、一律のデコンプレッションではなく特定のクエリニーズに基づいて動的に計算資源を管理します。システムは 5x から 15x の印象的な圧縮比率をサポートし(5x、10x、および 15x を含む)、ストレージ要件を大幅に削減しつつデータのアクセシビリティを維持します。Apple Modified Qwen アーキテクチャに基づいて構築された LensVLM はオープンソースであり、コードは Apple Sample Code License、モデルファイルは Apple Machine Learning Research Model License の下で入手可能です。ユーザーは GitHub リポジトリ(https://github.com/apple-aiml-research/ml-lensvlm)をクローンしてシステムをインストール・実行し、`python scripts/run_demo.py

または
demo.py
 を実行することで推論またはカスタムドキュメントクエリを実行できます。モデル経路(
apple/LensVLM-9B`)、テキストファイル、質問、圧縮レベルなどのオプションを指定します。追加のデータ準備および評価の詳細は、リポジトリの README に記載されています。この研究は Xie Roy、Dan Friedman、Donghan Yu、Bowen Pan、Christopher Fifty、Jang-Hyun Kim、Xianzhi Du、Zhe Gan、Vivek Rathod、Bhuwan Dhingra の氏により執筆され、論文は arXiv プリアプリント 2605.07019(2026 年にリスト)と識別されています。今後の開発では、利用可能なトレーニングデータに基づいてパフォーマンスを向上させるためのツール選択論理のさらなる最適化が予定されています。最終的に、LensVLM は効率的なストレージと高忠実度な検索のギャップを架橋し、ローカルで複雑なテキスト・イメージドキュメントを取り扱う方法に革命をもたらします。

Improved Summary:

レンズ VLM(LensVLM)は、90 億パラメータ規模の視覚言語モデルであり、大規模ドキュメントデータの管理に対して画期的なアプローチを導入するものです。これは、選択的デコンプレッションを視覚言語ワークフローに統合することで実現されています。高解像度のドキュメント全体を保存・処理するのではなく、この特殊化されたモデルは圧縮されたテキスト画像をスキャンし、学習されたツールを用いて関連するページのみをインテリジェントにフル解像度に戻すという方式を採用します。この機構は、視覚表現の圧縮問題に対して効果的に対処し、画一的なデコンプレッションではなく、特定のクエリニーズに基づいて動的に計算資源を管理します。システムは 5 倍から 15 倍(5 倍、10 倍、および 15 倍を含む)の圧縮比率をサポートし、ストレージ需要を大幅に削減しながらデータのアクセシビリティを維持します。Apple の Modified Qwen アーキテクチャを基礎として構築された LensVLM はオープンソースであり、コードは Apple Sample Code License、モデルファイルは Apple Machine Learning Research Model License の下で入手可能です。ユーザーは GitHub リポジトリ(https://github.com/apple-aiml-research/ml-lensvlm)をクローンしてシステムをインストールし実行でき、`python scripts/run_demo.py

または
demo.py
 を実行することで推論またはカスタムドキュメントクエリを実行できます。モデルパス(
apple/LensVLM-9B`)、テキストファイル、質問、圧縮レベルなどのオプションを指定します。追加のデータ準備および評価の詳細はリポジトリの README にあります。本研究は Xie Roy、Dan Friedman、Donghan Yu、Bowen Pan、Christopher Fifty、Jang-Hyun Kim、Xianzhi Du、Zhe Gan、Vivek Rathod、および Bhuwan Dhingra の氏により執筆され、論文は arXiv プリアプリント 2605.07019(2026 年にリスト)として識別されています。今後の発展では、利用可能なトレーニングデータに基づいてパフォーマンスを向上させるためのツール選択論理のさらなる最適化が約束されています。最終的に、LensVLM は効率的なストレージと高忠実度な検索のギャップを架橋し、ローカルで複雑なテキスト・イメージドキュメントを取り扱う方法に革命をもたらします。

本文

LensVLM:圧縮画像による文脈の選択的拡張

概要

  • LensVLM は、90 億パラメータ規模のビジョン・ランゲージモデル(VLM)です。
  • テキストを圧縮した画像をスキャンし、学習済みツールを用いて必要なページのみを選択的に元の非圧縮形式に戻す機能を備えています。

リポジトリとライセンス情報

  • 論文タイトル: LensVLM: Selective Context Expansion for Compressed Visual Representation of Text
  • ソースコード: GitHub
  • モデルファイルのライセンス: Apple Machine Learning Research Model License(Apple の Qwen モデルに対する改変を含む)
  • ソースコードのライセンス: Apple Sample Code License

使用方法

インストールとデモ実行

LensVLM のコードをインストールし、推論を実行するには以下のコマンドを使用してください。

git clone https://github.com/apple-aiml-research/ml-lensvlm
cd ml-lensvlm
pip install -r requirements.txt
python scripts/run_demo.py --model apple/LensVLM-9B

カスタム文書の処理

自社のドキュメントを処理するには、以下のパラメータを指定して実行します。

python demo.py \
    --model apple/LensVLM-9B \
    --text_file document.txt \
    --question "What is the main finding?" \
    --compression 10x

圧縮オプション

  • 利用可能な圧縮倍率: 5 倍, 10 倍, 15 倍
  • より詳細なデータ準備や評価方法は、リポジトリ内の
    README
    をご参照ください。

引用情報

@article{xie2026lensvlm,
  title={LensVLM: Selective Context Expansion for Compressed Visual Representation of Text},
  author={Xie, Roy and Friedman, Dan and Yu, Donghan and Pan, Bowen and Fifty, Christopher and Kim, Jang-Hyun and Du, Xianzhi and Gan, Zhe and Rathod, Vivek and Dhingra, Bhuwan},
  journal={arXiv preprint arXiv:2605.07019},
  year={2026}
}

同じ日のほかのニュース

一覧に戻る →

2026/09/24 3:06

クローデが CRISPR 様反復構造を持つ新たな酵素系を発見した

## Japanese Translation: Anthropic は、基礎生物学に特化した新たな Life Sciences 研究グループを立ち上げ、Claude エージェントを使用して DNA データセットを探査し、人間の科学者とともに物理実験室で仮説を検証する取り組みを開始しました。2026 年春、チームはベイエリアに自社工場を建設し、BSL-1/BSL-2 の安全制限下で低リスクの実験のみを行い、すべての実験作業は人間が行う体制を整えました。約 21 時間にわたって約 2 億 1,000 万トークンを処理する約 950 台の自律型 Claude エージェントが、大規模な遺伝子データベースを走査して興味深い逆転写酵素の例を探しました。1 つのエージェントは、RT ゼーン近傍にあるタンデムリピートアレイを発見し、CRISPR 技術に類似していることに着目することで、「配列関連型逆転写酵素(ART)」システムを特定しました。ART システムは 3 つの部分で構成されており、巨大なファージ由来の逆転写酵素、隣接するパートナー遺伝子、ならびに短い RNA として発現する非コード DNA のリピート配列が均等間隔で並ぶ長アレイからなります。CRISPR 先駆者である Feng Zhang 氏による見解を得たうえ、Anthropic の異種タンパク質に関する専門知識を背景に、プロジェクトは一般公開用のプレプリント技術報告書を発行し、物理実験における本質的な人間の監督下で実行されるスケーラブルな AI 主導の仮説検証において新たな先例を確立しました。

2026/09/24 6:01

VSCode の SSH アгентは素晴らしいです

## Japanese Translation: セキュリティ研究者のトーマス・プタチェクは、Visual Studio Code の SSH 遠隔編集機能はシステム整合性に対して深刻な脅威をもたらすと警告しており、Emacs Tramp といった代替手段の安全限界をはるかに超えていると指摘している。Tramp がリモート接続上でローカルに動作する一方、VSCode は Bash スニペット的なステーガーを実行し、エージェントをダウンロードして Node.js バイナリをインストールすることで、「フルスケールの侵入」を行う点で異なる。このダウンロードされたエージェントは、ローカルの VSCode フロントエンドとの間で永続的な WebSocket 接続を維持し、ファイルシステムを探索したり、任意のファイルを編集したり、独自のシェル PTY プロセスを開始したり、リモートシステム上にて自身を持続化したりする能力を有している。プタチェクは、LLM の「幻覚」はエージェントを通じて LLM と実行環境の間でループを閉じることで軽減できると認めつつも、そのようなプロセスは開発用ラップトップにおいては境界上の問題により実施すべきではないと指摘する。理想的には、LLM エージェントを用いた反復開発は、ホストシステム構成を変更できず瞬時に起動されるクリーンスレート Linux インスタンス上で行われるべきである。プタチェクは、この機能を開発サーバーで使用する際に懸念を覚えるだろうし、本番システムでのインシデント中に発生すれば怒り狂うだろうと警告している。また、Fly Machine のカスタム接続はこの懸念を回避可能だが、彼のブログの主な目的はこのセキュリティ洞察を読者に共有することにあることを明記している。

2026/09/24 6:31

クレードの荷重支持継ぎ目

## Japanese Translation: 核心的な論点とは、荷重支持接合部(load-bearing seams)が偶発的な詳細ではなく、重要な構造的要素であるというものであり、状況の理解方法を本質的に変えるものである。表面的な問題と深層的な構造的な問題の間に違いが存在し、元の結論は提示された質問に答えつつも、その証拠が実際に接合部について問いかけていたことを扱わなかった。状況を単一のバイナリ(二値)に還元することはニュアンスを失わせ、代わりに複数の真理を生産的な緊張関係の中で保持すべきである。重要な過ちの一つは、単に記述する証拠と実際の構造的作業を行う証拠の区別を行わなかった点にある。不確実性はノイズを排除すべきものではなく、複数の解釈を可能にするモデルの限界を示しており、分析は複雑性を増しつつ、外観・支持された主張・整合性にとって必要な真理の間の関係を明確化している。今後には、初期の仮見直しを行い、証拠を荷重支持接合部に直接的に対置して再評価することが必要であり、新しい結論に急ぐこと 대신 収束(convergence)を目指すべきである。最も高いレバレッジを持つ行動は、記述的な外観から構造的現実がどの点で乖離しているかを特定し、特に接合部を中心に例外、パターン、カテゴリーエラーを把握することにある。この転換により証明責任の枠組みが再定義され、元の結論が接合部を回避するのではなくそれを考慮するようになり、結果的に組織が表面の詳細と本質的な構造的制約との関係をどのように変革するかを示す。

LensVLM:長文脈を画像として圧縮し、関連するページのみを拡大表示する | そっか~ニュース