Hister – あなたが制御する完全なコンテンツ検索インデックス付きのプライベートソリューション

2026/08/19 5:00

Hister – あなたが制御する完全なコンテンツ検索インデックス付きのプライベートソリューション

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

Hister は、データの完全な所有権を提供することを目的とした、自己管理可能でプライバシー第一のローカル検索エンジンです。テレメトリやクラウドリクエストを一切行わずに完全にオフラインで動作し、ファイル名やブックマークだけでなく全文書コンテンツを保存・インデックス化します。これにより、フィールド、フレーズ、ワイルドカード、否定、優先度、エイリアス、日付範囲を使用した精密な検索が可能となり、検索文脈を保持したクリーンなページプレビューも提供されます。Hister はローカルフォルダ、ブラウザ履歴、訪問済みページ(拡張機能経由)、Web クローラーからのコンテンツをインデックス化し、言語固有のインデックス、コンテンツバージョン管理、所有権ルール、設定可能なエクストラクタなどの高度な機能をサポートします。ウェブインターフェース、ターミナル/CLI、HTTP API、AI アシスタント用の MCP を介してアクセスでき、単一のマシンまたは共有サーバー上で動作することが可能で、SQLite または PostgreSQL を使用して安全かつスコープされたアクセスを確保します。AGPLv3 ライセンスの下にあり、ソースコードは公開監査可能です。今後のアップデートでは、外部埋め込みを通じた意味検索やブラウザ拡張機能によるファビコンサポートが追加される可能性があり、利便性を拡大しつつも厳格なプライバシー基準を維持することを目指しています。

本文

Hister: プライバシー重視のセルフホスト検索エンジン

基本的な特徴

  • 完全な自己管理
    • ご自身のマシンまたはサーバー上で動作します。
    • テレメトリー(使用状況収集) および外部へのリクエストは一切行いません
    • プライバシーを最優先とした設計です。
  • 知識の保存と再発見
    • 抽出されたドキュメントの内容を検索インデックスと共に格納します。
    • 検索結果の横に、可読性の高いプレビューを表示します。
  • データ統合能力
    • ブックマークやファイル名だけでなく、ページ・ファイルの実内容そのものも対象にします。
    • ブラウザ拡張機能、ローカルフォルダ監視、履歴インポート、サイトクロールにより多様なデータを同一インデックスへ取り込みます。

検索と抽出機能

  • 高精度な検索
    • タイトルや URL だけでなく、インデックス化された各ドキュメント内の文字列そのものを検索対象とします。
    • 以下の高度な絞り込みが可能です:
      • フィールド指定
      • フレーズ一致(クォート付き)
      • ワイルドカード
      • 否定表現
      • 優先度設定
      • クエリエイリアス(別名)利用
  • 文脈を保った閲覧
    • 検索を中断することなく、結果の横にクリーンな保存済みプレビューを開いて閲覧できます。
  • コンテンツ抽出
    • 対応フォーマットおよびウェブサイトから構造化データを処理します。
    • 言語に敏感なインデックス化が可能です。

プライバシーとセキュリティ

  • データ管理の完全性
    • インデックス、格納されたページコンテンツ、およびルール設定はすべて、あなた自身が構成するHister サーバー上に保持されます。
    • クラウドサービスへの依存が不要です。
  • 具体的なプライバシー保証
    • テレメトリーなし: サーバーが「ホームに電話」したり、検索内容を報告したりすることはありません。
    • 強制クラウド不要: 完全な個人利用設定は単一のローカルマシン上で動作します。
    • 選択されたサーバー: クライアントはインデックス化データをあなたが構成した Hister サーバーのみを対象とします。
  • 監査可能性
    • ソースコードが公開されており、AGPLv3 ライセンスのフリーソフトウェアです。
    • ブラウザ拡張機能によるページファビコン取得など、接続の有無や実行場所はユーザーが選択可能です。
    • 機密情報へのチェック機能(機密内容検知)を備えています。

インデックス管理とルール

  • 1 つのインデックスで多様なアプローチ
    • 訪問済みページ、監視中のファイル、インポート履歴、クロールデータを単一のインデックスへ集約します。
    • バージョン管理により以前のドキュメントコンテンツを保持できます。
  • 適用ルール
    • スキップ規則と優先度規則により、インデックス化とランキングが制御されます。

インターフェースとデプロイ

  • 多様な利用方法
    • 同一のインデックスは以下の手段で利用可能です:
      • Web インターフェース
      • ターミナルクライアント / CLI(コマンドラインインターフェース)
      • HTTP API
      • MCP サーバー(Model Context Protocol による AI アシスタント連携対応)
  • デプロイオプション
    • 設定なしのクイックスタート: 単一のバイナリでローカル環境実行が可能。
    • データベース: SQLite または PostgreSQL を使用。
    • ユーザー管理: ユーザー固有のアクセス権限をサポート。
    • コンテナ化: Docker と Nix での動作に対応。

その他の機能

  • 複数のクロラーバックエンドへの対応
  • オプション的な意味的検索(埋め込みモデルエンドポイントへの送信)
  • 構成可能な抽出器

同じ日のほかのニュース

一覧に戻る →

2026/08/23 3:14

なぜあなたのローカル LLM は実際より知的に見えなくなるのか

## Japanese Translation: 本稿は、標準的なベンチマークが大型言語モデル(LLM)の性能を正確に測定できないことへの警告を示しています。推論中のロジット計算における実装固有のリスク、特に nightly バルドを利用するユーザー構成などが原因で重大な出力エラーが生じる可能性があるためです。ロジットの微小なシフトが結果の乖離を引き起こし、単純な精度指標を誤導的なものに変えてしまいます。さらに、数百のパッケージを含む NVIDIA nightly イメージなど、複雑な構成は推論パスに影響を与える隠れたバグをもたらします。KL ダイバージェンスなどの指標に基づき低誤差率を主張する一部の量化手法については、ロジット計算に用いられる CUDA カーネルやテスト手法に関する完全な透明性が欠ける限り、その主張は欺瞞的であり得ます。Qwen3.6-27B モデルに対して FlashAttention 2、Flash Inference、Triton Attention の 3 つの注意力バックエンドを実践的に比較した実験では、初期トークンの一致は見られましたが、量化テストの基準として Triton を用いた際には後に不一致が生じました。KV カッシュを quantize(int4/int8)としつつ重みを BF16 で維持する構成ではツール呼び出しエラーが発生し、int4 では乖離から回復できませんでした。5 つの構成に対する評価の結果、INT8 バージョンが他のどの構成よりも優れており、約 5% のトークンフリップしか起こさずに 88,000 トークンのコンテキストを処理し、コマンドを正しく実行することができました。一方、NVIDIA の NVFP4 および AWQ W4A16 バージョンは高いトークンフリップ率(NVFP4 では約 50%)を示し、特定の命令実行に失敗しました(例:Cisco コマンド)。したがって、正確なコマンド実行を必要とする生産環境負荷においては、曖昧な精度主張やドキュメント化されていないリスクに曝露されやすいデフォルト構成に頼るのではなく、実証された安定性を有する特定のハードウェア構成に依存することが不可欠です。

2026/08/23 4:07

NetBSD と私の人生(2005 年)

## 日本語訳: 要約:2年間にわたり、英国の企業が不安定だった Windows サーバーから NetBSD に移行することに成功し、顕著な安定性を達成し、かつて家族がアルトン・タワーズへの旅行という重要なイベントを妨害したような高価なダウンタイムを排除しました。リーダーシップはインフラ切り替えから2時間以内で移行の検証を行いました。現在のネットワークには、MySQL、Apache(重い PHP サイトを含む)、メール向けの Postfix、Linux ファイルサーバーとの NFS 接続向けの Samba を採用した、29 台の高機能なサーバーが稼働しており、1 日あたりのデータ処理量は 870GB 超です。当初、管理者はオープンソースの経験を持たなかったものの、システムの設定、カーネルのコンパイル、SSH を通じた環境の遠隔管理を短期間で習得し、ストレスに満ちた週末のオンコールシフトを終えました。この移行は、障害を防ぐことで大幅なコスト削減を実現し、スタッフには技術的な中断 없이家族と過ごす uninterrupted な時間を可能にしました。

2026/08/22 23:54

ElevenLabs、TwelveLabs、ThirteenLabs

## 日本語翻訳: 元のサマリーは明確であり、簡潔で、主要な論点を一貫した物語に効果的に統合しています。それは Sevenytonelab.com が、レトロなデザインと旧来の Web 技術(Netscape 4 または IE 5.0+ など)への依存により、AI スタートアップにおいて独特の異例として浮き彫りにされるという主なメッセージを成功裡に伝えています。多くの近代 AI 企業は、数字を"labs"という言葉と組み合わせた命名トレンドに従っていますが、これは ElevenLabs, TwelveLabs, ThirteenLabs(3D シーン), FourteenLabs のようなwell-known エンティティが示す例であり、Sevenytonelab はこの慣習に背いています。著者は、特定の基準に基づいてこの独特のケースを特定しました:オンラインでのアクティブな存在、「labs」が含まれた名称、人工知能との関連性(.ai ドメインまたは主要製品において AI が核心となることによる定義)。現在のサイトとは異なり、Sevenytonelab は 2000 年代初期の Web ポートフォリオや IDM アルバムカバーに見られるデザインスタイルを想起させ、「vectorheart」というグラフィック要素を特徴としています。この視覚的および技術的な区別は、それが現在の命名進化の一部ではなく異常な存在であることを示します。本文は完全には、七十七トンラボの陳腐化したデジタルアイデンティティが近代人工知能同僚と鮮明に対照となるように、既存の比較のみを強調し、未来のトレンドへの言及や業界全体の影響についての議論を行わず、Sevenytonelab のこの点だけを明らかにしています。 ## 原文: The original summary is clear, concise, and effectively integrates all key points into a coherent narrative. It successfully conveys the main message: that Seventyonelab.com is a unique anomaly among AI startups due to its retro design and reliance on legacy web technologies, contrasting sharply with modern naming trends and digital identities. No improvements are necessary; the summary remains as is. ## 日本語翻訳: 元のサマリーは明確であり、簡潔で、主要な論点を一貫した物語に効果的に統合しています。それは Sevenytonelab.com が、レトロなデザインと旧来の Web 技術(Netscape 4 または IE 5.0+ など)への依存により、AI スタートアップにおいて独特の異例として浮き彫りにされるという主なメッセージを成功裡に伝えています。多くの近代 AI 企業は、数字を"labs"という言葉と組み合わせた命名トレンドに従っていますが、これは ElevenLabs, TwelveLabs, ThirteenLabs(3D シーン), FourteenLabs のような well-known エンティティが示す例であり、Sevenytonelab はこの慣習に背いています。著者は、特定の基準に基づいてこの独特のケースを特定しました:オンラインでのアクティブな存在、「labs」が含まれた名称、人工知能との関連性(.ai ドメインまたは主要製品において AI が核心となることによる定義)。現在のサイトとは異なり、Sevenytonelab は 2000 年代初期の Web ポートフォリオや IDM アルバムカバーに見られるデザインスタイルを想起させ、「vectorheart」というグラフィック要素を特徴としています。この視覚的および技術的な区別は、それが現在の命名進化の一部ではなく異常な存在であることを示します。本文は完全には、七十七トンラボの陳腐化したデジタルアイデンティティが近代人工知能同僚と鮮明に対照となるように、既存の比較のみを強調し、未来のトレンドへの言及や業界全体の影響についての議論を行わず、Sevenytonelab のこの点だけを明らかにしています。 ## 原文: The most significant observation is that Seventyonelab.com stands out as a unique outlier among AI startups due to its retro aesthetic and reliance on legacy web technologies like Netscape 4 or IE 5.0+. While many modern AI companies follow a naming trend by combining numbers with the word "labs"—exemplified by well-known entities such as ElevenLabs, TwelveLabs, ThirteenLabs (3D scenery), and FourteenLabs—Seventyonelab defies this convention. The author identified this distinct case based on specific criteria: an active online presence, the inclusion of "labs" in the name, and a connection to artificial intelligence (defined by either an .ai domain or AI central to main products). Unlike contemporary sites, Seventyonelab evokes the design style of early 2000s web portfolios and IDM album covers featuring a "vectorheart" graphic element. This visual and technical distinction marks it as an anomaly rather than part of the current naming evolution. The text focuses entirely on this existing comparison without projecting future trends or discussing broader industry impacts, simply highlighting how Seventyonelab's outdated digital identity contrasts sharply with its modern artificial intelligence peers.