DeepSeek Harness で研究データ分析:10 万行の前処理・統計・図表をワンセッションで

22 分のスクリーン録画を全コマ確認した図解ガイド。101,766 行の糖尿病 EHR データセットを dsh に渡せば、前処理・品質監査・Cox 生存時間分析・ジャーナル級図表・整形済み Results 章をひとつのセッションで——API 費用は 3.10 元。

最終更新: 2026-10-01

DeepSeek Harness による US Hospitals Diabetes データセットのクリーニング概要:重複なしで 101,766 サンプルを保持、定数 2 列を除外して特徴量 50 → 48、メモリは 248.7 MB から 21.5 MB へ 91% 圧縮——再利用可能な data_quality_audit.py コマンド付き
クリーニング概要:10 万行のプロファイリング完了、メモリは 248.7 MB から 21.5 MB へ

実際の研究データは扱いにくいもの:符号化された列、混在する型、10 万行単位のボリューム。このガイドは 22 分のスクリーン録画(出典はページ末)をなぞったものです。研究者が実在の公開データセット——10 万行の US Hospitals Diabetes EHR 入院テーブル——を DeepSeek Harness に渡すと、ひとつのセッションでデータ把握・前処理・品質レポート・Cox 生存時間分析・論文級の図表・整形済み Results 章が揃い、費用はペットボトル 1 本ほど。

以下の各ステップはすべて全コマ確認済みのスクリーンショットで、元動画の該当秒へのディープリンク付き。まだ dsh を導入していない方は、まずこちらから: DeepSeek Harness とは?dsh プラグインとは?

TL;DR

  • ▸実在の 101,766 行 EHR テーブルにプロンプト 1 つ:常時「No」の 2 列(examide・citoglipton)を除外し、特徴量は 50 → 48、型変換でメモリ 91% 圧縮——248.7 MB → 21.5 MB。
  • ▸エージェントは自分で自分を監査:監査スクリプトのバグ 2 件を検出し、4 回の Edit で修正して再実行、データ品質レポートを提出——6 ラウンド 98 ステップ、手書きコードはゼロ。
  • ▸中国語の Cox プロンプト(「変数の選択はお任せ」)に「Nature 級の図表」を追加するだけで、lifelines / R survival のコードと dpi=300 の PNG+SVG 図表が手に入る。
  • ▸Results 章は整形済み Word 文書として出力——数値はすべて実計算、三線表ルール準拠——録画全体の API 費用は 353 リクエスト合計 3.10 元。

10 万行の生テーブルから Results 章まで

パート 1 · 初回セットアップ

  1. 1

    自分の DeepSeek API キーをつなぐ

    すべて自分のキーで動きます。録画では作者がまず開発者プラットフォームの利用状況ページを開き——残高 5.67 元、累計消費 14.32 元、それまでの 254 リクエスト・3,255,296 トークンを確認——新しいキーを作成して dsh の「API キーを追加」ダイアログに貼り付けます。このページは最後のステップで明細確認に使うので、開いたままに。

    録画内でキー作成前に開かれた DeepSeek 開発者プラットフォームの利用状況ページ:残高 5.67 元、累計消費 14.32 元、直近 30 日で 254 リクエスト・3,255,296 トークン
    まず DeepSeek 開発者プラットフォームでキーを取得——このページは最後の明細にもなります2:45 から見る
  2. 2

    モデルを選ぶ:V4-Flash か V4-Pro か

    07_医学与健康医療(Medical & Health)ワークスペースで新規セッションを開くと、モデルピッカーには 2 つだけ:デフォルトの DeepSeek-V4-Flash(High 推論設定)と DeepSeek-V4-Pro。前処理・統計・図表・Word 作成までの 22 分間はすべて V4-Flash で走りきります。Pro は重い処理向け。

    DeepSeek Harness の Medical & Health ワークスペース新規セッション画面でモデルドロップダウンを開いたところ:DeepSeek-V4-Flash(チェック済み)と DeepSeek-V4-Pro の 2 択
    ピッカーに選択肢は 2 つ:全行程 V4-Flash(High)で走りきる3:45 から見る
  3. 3

    生の 10 万行テーブルをそのまま渡す

    デモデータは実在の公開データセット US_Hospitals_Diabetes:101,766 件の入院レコードを持つ 10 万行 EHR テーブルです。Excel で開くと意図的に「扱いにくい」状態——数式バーには符号化された race の値、薬剤列は No / Steady / Down / Up だらけ、1 行ごとに型が混在。そのまま dsh に渡せば OK。デコードはエージェントの仕事です。

    Excel で開いた US_Hospitals_Diabetes 10 万行 EHR の生シート:数式バーには符号化された race の値、16-42 行目の薬剤列は No・Steady・Down・Up で埋まっている
    生テーブルはこう見えます:符号値と混在型のままそのまま渡す5:00 から見る

パート 2 · 前処理・監査・統計

  1. 4

    プロンプト 1 つで前処理開始——エージェントが自分自身を点検

    中国語の一文——データ把握・クリーニング・品質監査——でパイプラインが動き出します。セッションは data_quality_audit.py を書き、さらに自分のコードのバグ 2 件を検出:型推論の順序が age/weight 区間列で to_datetime 警告を出す問題と、欠損辞書のタプル取得ミス。4 回の Edit、PowerShell での再実行、01_Diabetes_EHR_data_quality_report.md の読み返し——6 ラウンド 98 ステップ、LLM 24分07秒、キャッシュヒット 99%。残されたスクリプトは再利用可能:

    $python data_quality_audit.py 你的数据.csv # 只体检
    $python data_quality_audit.py 你的数据.csv --map 映射.csv # 解码编码列
    $python data_quality_audit.py 你的数据.csv --no-clean # 不生成清洗数据
    DeepSeek Harness のセッション履歴:エージェントが自分の data_quality_audit.py に 2 件の問題(to_datetime 推論警告とタプル取得ミス)を報告し、4 回の Edit・PowerShell 再実行・01_Diabetes_EHR_data_quality_report.md の読み返しまで完走
    自己点検:4 回の編集・再実行・レポート読み返し、人手はゼロ1:00 から見る
  2. 5

    ペルソナプロンプトで統計検定を追加

    統計も同じやり方。録画では「あなたは腫瘍と慢性疾患の生存時間分析統計家です……Python lifelines / R survival で Cox 比例ハザード回帰コードを書いてください」というペルソナを入力し、追跡時間・イベント変数・層別化・共変量はあえて空欄(「必要な変数はあなたが決めて」)、最後に「あなたは Nature 級の研究図表ビジュアライザーです」を添えます。この時点で入力ボックスの上では、レポート検証が examide の除外とクリーニング後 CSV の構造確認を済ませています。

    dsh の入力ボックスに入力中の Cox 比例ハザード回帰ペルソナプロンプト:Python lifelines / R survival での生存分析コードを求め、追跡時間・イベント変数・層別化・共変量はエージェントに委ね、Nature 級の図表も追加依頼
    中国語のプロンプト 1 つで:Cox 回帰の変数選択はエージェントに、図表も一緒に依頼10:15 から見る

パート 3 · 図表・論文・明細

  1. 6

    ジャーナル級の図表は成文化された仕様どおり

    図表がきれいなのは運ではありません。作者は 16 ページのプロンプトマニュアル(出典を参照)を保守していて、11 ページ目に raincloud 図のレシピを固定しています:半分バイオリン KDE + 箱ひげ図 + ジッター散点(alpha=0.6)、有意差ブラケット(p<0.05 / 0.01 / 0.001)、Nature/Lancet パレット #4DBBD5 #E64B35 #00A087 #3C5488、上部・右側軸の削除(sns.despine)、さらに dpi=300 の PNG とレイアウト用 SVG の保存をハードルールに。

    16 ページのプロンプトマニュアル 11 ページ目に書かれた raincloud 図の仕様:半分バイオリン KDE + 箱ひげ図 + ジッター散点(alpha=0.6)の 3 層構造、p<0.05〜p<0.001 の有意差ブラケット、Nature/Lancet パレット #4DBBD5 #E64B35 #00A087 #3C5488、dpi=300 での PNG と SVG 出力
    マニュアル 11 ページ目:raincloud のレシピ・配色・有意差ブラケット・dpi=300 の規則15:00 から見る
  2. 7

    Results 章は自動執筆——数値は全部実計算

    generate_results_docx.py が output_results.docx を生成し、統計量は「でっち上げ」ではなく計算されたもの——セッションの言葉そのまま「統計量はすべて 1,000 行の実データから計算」。デモ版の Results は 1,000 件の入院サブセット:投薬あり 796 例 vs なし 204 例、年齢 59.86±17.54 vs 64.41±17.24(Welch t = 3.35、P < 0.001)、救急入院 21.0% vs 9.8%。Table 1 は標準的な三線表(頂線・底線 1.5 pt、欄頭線 0.75 pt、縦線なし)に整形され、セッションはさらに XML レベルのレイアウト検証(122 個の Run すべてフォント適合)まで実行します。

    DeepSeek Harness が生成した output_results.docx:「3. 結果(Results)」章に 1,000 件の入院サブセットのベースライン——59.86±17.54 vs 64.41±17.24 歳、Welch t = 3.35、P < 0.001——が書かれ、続いて非投薬 204 例 vs 投薬 796 例を比較する Table 1
    Word 版 Results 章:数値は実計算、Table 1 は標準三線表16:00 から見る
  3. 8

    成果はチャットではなくフォルダに全部残る

    実行後、ワークスペースフォルダには 23 個のアイテムが:両フォーマットの図表(Fig1_group_difference.png 146 KB + .svg 204 KB)、4 本のスクリプト(raincloud_plot.py、survival_cox_analysis.py、data_quality_audit.py、verify_and_explore_medical_data.py)、survival_analysis_report.md、クリーニング済みの survival_dataset.csv、Word レポート。データを変えて再実行すれば同名ファイルは上書き——成果はセッションの中だけに生きていません。

    Windows エクスプローラーに並ぶ dsh 実行の成果物:Fig1_group_difference.png と .svg、raincloud_plot.py、survival_cox_analysis.py、survival_analysis_report.md、クリーニング済み survival_dataset.csv、data_quality_audit.py など 23 アイテム
    実行後:図表・スクリプト・レポート・クリーニング済みデータ、すべて普通のファイル15:30 から見る
  4. 9

    自慢する前に明細を確認

    動画は DeepSeek の利用状況ページで締めくくられます:前処理・統計・図表・Word 作成の全体で、表示月の消費は 3.10 元、353 リクエスト、16,137,371 トークン、8 月 16 日のピークは 0.73 元(deepseek-v4-flash)。自分の初回実行後も、同じページで明細を確かめましょう。

    分析完了後の DeepSeek 開発者プラットフォーム利用状況ページ:当月の消費は 3.10 元、353 API リクエスト、16,137,371 トークン、8 月 16 日のバーは deepseek-v4-flash で 0.73 元
    明細:録画された全ワークフローで 3.10 元・1,613 万トークン21:00 から見る

FAQ

研究データを dsh に渡す前に、よく聞かれる質問。

Python も統計もわからなくても大丈夫?

大丈夫です。録画内のプロンプトはすべて普通の中国語。コードはエージェントが書き、デバッグし、再実行します——監査スクリプトのバグ 2 件を自発的に修復したほどです。ただし公開前の統計の妥当性判断はあなた自身の仕事:動画の作者も最後に自分でコードと表を見直しています。

糖尿病データセット専用?

いいえ。US_Hospitals_Diabetes は公開のデモにすぎません。録画のワークスペースには冠動脈疾患・ロッテルダム乳がん生存・パーキンソン遠隔モニタリング・Pima インディアン糖尿病など他の公開データもあり、残されたスクリプトはパラメータ化済み——data_quality_audit.py を任意の CSV に向ければ動き、--map で符号化列をデコード、--no-clean で検査のみ実行できます。

10 万行のテーブルでマシンが悲鳴を上げませんか?

録画は逆の結果を見せています:数値列を int64/float へ、カテゴリ列を順序付き category へ変換した時点で、テーブルのメモリは 248.7 MB から 21.5 MB へ——分析開始前に 91% やせました。プロファイリングを先に済ませるので、数値に触れる前にデータの形が見えます。

Results 章はそのまま論文に使えますか?

「検証可能な初稿」と扱ってください。セッションはデータから統計量を実際に計算し(デモのサブセットは 1,000 件の入院)、docx の XML レベル検証(フォント・行間・三線表の罫線)まで行いますが、作者自身もコードと表を目視確認してから信じています。自分の環境で数値を再現し、統計の専門家にレビューを——このページは手法のデモであり、医学的助言ではありません。

関連ガイド

同じエンジン、隣のワークフロー。

出典とクレジット

スクリーンショットと画面上の数値はすべて 1 本目の動画から、フル解像度で再読したもの。研究プラグインのリストは 2 本目の動画で裏取り、図表と三線表のルールは作者公開のプロンプトマニュアルから引用しています。データセットは作者が公開データと明示しているもので、表示された統計結果はワークフローのデモであり医学的助言ではありません。

DSH Plugins は DeepSeek Harness プラグインの独立したコミュニティ ディレクトリです。DeepSeek との提携・公認はありません。サードパーティ製プラグインはセキュリティ監査を受けていません。インストール前にソースコードをご確認ください。

DeepSeek Harnessの新着プラグインを毎週お届け。スパムはありません。