AIおよびRAG検索のためのLotusスプレッドシートアーカイブの準備
AI、データ、ナレッジマネジメントチームがプライベートRAGシステムを構築するためのもの。

要点
LLMおよびRAGパイプラインは、.wk1、.wk3、.wk4、または.123ファイルを直接インデックス化できません。パイプラインに入る前に、レガシースプレッドシートをローカルでCSV、Markdown、およびXLSXに変換してください。CSVおよびMarkdownは、埋め込みと検索に最適な入力です。XLSXおよびPDFは、モデルに表示される内容の人間によるレビューをサポートします。
AIは読めないものは使えない
ほとんどのリトリーバルおよび埋め込みパイプラインは、古いスプレッドシートのバイナリを静かにスキップします。その結果、会社の実際の知識の一部から質問に自信を持って答えるプライベートRAGシステムが生まれます—しかも、何が除外されたのか誰も気づかないことがよくあります。
アーカイブの近代化は、地味だが必要な前提条件です:クリーンでオープンなフォーマットが、従来のフォーマットが隠していたスプレッドシートの履歴を解放します。
RAGに最適なターゲット形式
一. CSV の表形式埋め込み用
CSV は最もクリーンな表形式の入力です。各行は小さく予測可能なチャンクになり、列は自然なメタデータになります。CSV を行レベルのメタデータとインデックスでペアにして、年、エンティティ、または元のワークブックでフィルタリングできます。
二. ナラティブタブ用のMarkdown
多くのLotusワークブックには、前提、変更履歴、エグゼクティブサマリーなどのナラティブタブが含まれています。MarkdownはHTMLやPDFのテキストよりもLLMのトークン化に適しているため、変換後の引用にはサマリータブの方が適しています。
三. 人間によるレビューのための XLSX と PDF
レビュアーがモデルに何が表示されたかを確認する必要があるとき、XLSX と PDF が彼らが期待するフォーマットです。それらを CSV/Markdown の隣に置いて、モデルの引用を視覚的に追跡できるようにしてください。
会話を非公開にしてください
アーカイブに財務、顧客、従業員、または運用データが含まれる場合、変換はクラウドAIのステップの前に行うべきであり、できればRAGパイプラインの他の部分がホストされている同じ管理された環境内で行うのが望ましい。
無料のオンラインコンバーターは、プライバシーを重視するAIシステムにとって不適切な依存です。それらは、プライベートなLLMが排除するよう設計されている正確にそのデータ居住性の問題を再び持ち込んでしまいます。
後で役立つインデックス作成のコツ
変換中にファイルごとのメタデータを取得します:ソースパス、出力パス、元の拡張子、変換タイムスタンプ、およびフォルダ構造から推測できるプロジェクト、年、またはエンティティ。これらのメタデータをフィルタ可能なフィールドとしてベクターストアにプッシュします。
アーカイブをRAG対応と宣言する前に、いくつかの既知の歴史的な質問に対してサンプルテストを実施する。適切な質問は、インデックスに入れる必要があるタブや仮定を明らかにすることが多い。
部分的なアーカイブにRAGを構築するのをやめてください
プライベートLLMの賢さは、見ることができるコーパスに依存します。レガシーのスプレッドシートアーカイブを一度変換し、メタデータでインデックス化し、モデルに会社が実際に知っていることをついに読ませましょう。
ファイルを変換
関連記事
レガシーのLotusアーカイブをあなたのプライベートAIコーパスの一部にする
代表的なアーカイブで試行Lotus Converterを行い、RAGパイプラインへの取り込み準備ができたCSV、Markdown、XLSX、およびPDFの出力を生成します。
無料トライアル
アプリの全機能 — 最大 10 ファイル
Windows 10 または 11
1つのオフラインインストーラー。同じフル機能トライアル — Lotus ファイルを最大 10 個までローカルで変換。
オフライン MSI · アカウント不要