1 of 23

Togothon147

2024/12/19-20

#wrap-up は2日目17:00からZoomで行います

Wiki に名前を書いてください

2 of 23

プロジェクト名(担当者)

課題

  • hoge

対応

  • fuga

今後

  • Moge

  • Moge

3 of 23

ラップアップ

Wrap-up

4 of 23

Microbiome Datahub (森, 藤澤, 大石)

課題: Microbiome Datahub正式版公開(来週必ず!)

対応: 1. オーソログDBのMBGDとPhenotype推定ツールBac2Featureの結果の

 Microbiome Datahubへ取り込みMAGごとのMBGD Orthologリスト、KOリスト、Phenotypeリスト)

2. メタデータ取得のためのMAGのBioProject-BioSample関係性記述

https://mdatahub.org/data/dev/all.svg , https://mdatahub.org/data/dev/layered_graph2.html

 3. Top page、Manual作成

今後: 来週Microbiome Datahub正式版公開、NBDCからニュースリリース

5 of 23

LLM vs BioSample (池田、大田、片山、守屋、川島)

  • 課題: LLM で BioSample のターム抽出ができたので論文を書く
  • 対応:
    • 論文のドラフトを書いた
    • KO, KD など、実験的に発現を調整された遺伝子名の抽出タスクにおける難しいケースについて沖さんと議論した
      • 遺伝子をノックアウトしているが、同じ遺伝子にエピトープタグを付けたものを導入している場合など。確かにノックアウトはされているけど、「その遺伝子がノックアウトされている」という条件で検索した場合にこれが取れるのはユーザーの意図の外であるのが普通
      • 今回の定量評価ではプロンプトの指示通りに抽出できているかどうかで判定をしたうえで、難しいケースの存在を論文中で取り上げて今後の課題として議論する
  • 今後: 論文を仕上げる

6 of 23

Pangenomics 入門(金城)

課題:ずぶの素人がpangenomicsの概要を理解する。

対応:いくつか論文を読む。以下、参考にどうぞ。

今後:しばらく消化する。

7 of 23

エンリッチメント解析(福島・三浦・吉沢)

課題

  • 質量分析メタボロームデータ用のmetabolite set作成

(要はGSEAのメタボローム版)ROIS-DS-JOINT

※ KEGG, MetaCycなどからも作れるが、過去データの再解析(例. 2群間比較)からも作りたい

対応

  • メタボロームデータレポジトリMetaboLightsにおいて、例としてヒト大腸癌データセットを探索し、メタデータを精査した結果、35データセットが群間比較に持ち込めそう

今後

  • 以下、順次進める:

1) 代謝物名、Compound DB-ID(例. HMDB)の統一、InChIKeyへの変換

2) 統計計算

3) gmt形式での取りまとめ

4) 他のがんデータセットへ展開

8 of 23

次期NBDCヒトDB/ホワイトボード会議(DBCLS/DDBJ/GAJ)

目標:利便性向上のための『申請窓口一元化』から『プレリサーチ』まで全体最適化

  • 今年度、シン・NBDCヒトDBポータルの開発項目について説明
    • 登録ナビゲーション→提供申請や公開系レポジトリ登録の動線
    • プレリサーチ(データセット検索)→利用申請の動線
    • 詳細ページ
      • hum ID+version毎の研究ページ
      • データセット毎のページ
    • 静的コンテンツ →markdownで編集
  • 次回:Togothon148の2日目 1/28 (火) 14:00-

9 of 23

フリーディスカッション

  • DB作るときのベストプラクティスがほしい
    • 更新日やエントリ数など表に出すべき情報を定義したい
  • 今からDB作るというときに……
    • こうしたらいいよというデザインパターン
  • DBCLSは参照系DBばっかり作ってきた
    • DDBJのようにsubmitを受け付けるrepo系のDBを作るツールやノウハウがない
    • Submit するのは大変
    • DDBJの偉大な発明である biosample package template Excel のようなものが「データ登録」のときではなく「研究開始」のときに必要
    • 「研究を始めるボタン」が必要
  • Togo座標 (IDで繋がらないfeatureがあるよね、たとえばTogoVarの立体構造に対するvarのマッピングとか)
  • GUIについてもベストプラクティスがほしい
    • 長大なファセット検索がだるい
      • LLMにやってほしい→頼んだら検索条件のURLを生成してくれる→一発で描画
      • それってAPIのspecをちゃんと書けばLLMが読んで書いてくれるみたいな話では?
    • オントロジールックアップのLLMフレンドリーなやつもほしい
  • Data management plan (DMP) なるものが研究費申請に必要となる
    • 「誰がどういうデータをどんくらい生成してどこにどう出すか」を書く

10 of 23

フリーディスカッション(続き)

  • 立体構造の座標データですが、原子のXYZ座標の値は座標系次第(並進回転)で変わってしまうので、そもそもあまり意味がないです。
    • 意味があるとすれば、残基間コンタクトの情報でしょう(これは座標系に依存しない)。例えば病気関連のヴァリアントのある残基とコンタクトしている他の残基があれば、後者に変異が入った場合にも病気になる可能性がある、とか推測できます。(実はブルネイに行く直前のPDBjの計画にはこういうことを書いてあったはずなのですが…)

11 of 23

全体連絡

Announcements

12 of 23

  • 今後の Togothon の日程調整 → 開催場所募集中
    • Togothon 148: 1/27-28(月-火) @ 日本橋室町 GLOBAL LIFESCIENCE HUB
    • Togothon 149: 2/20-21(木-金) @ 柏?北里?etc.
    • Togothon 150: 3/24-25(月-火)
  • Wiki に早めの記名をお願いします!(会議費申請のため)
    • 来月参加が決まっている方は、すぐに書き込んで頂けると助かります
  • BLAH9
    • 日時:2025年1月13日 (月)〜1月17日 (金)
    • データサイエンス共同利用基盤施設 (東京都立川市)
    • https://blah9.linkedannotation.org/
  • MedHackathon
  • BioHackathon 2025
  • 国内版バイオハッカソン:未定

13 of 23

TogoCSV

足がかりメモ

各DBに聞きたいこと

こちらのスライドに移動しました

14 of 23

以下はTogothon145のコピー

Previous slides

(書き換えたら全体連絡のスライドより前の方にスライドを移動してください

15 of 23

Microbiome Datahub (森, 藤澤)

課題: Microbiome Datahub正式版公開と論文

対応: 1. オーソログDBのMBGDとPhenotype推定ツールBac2FeatureのMicrobiome

 Datahubへ取り込み準備(MBGDオーソログクラスタ配列への全MAGの

 タンパク質の配列相同性検索、MAGの系統名リスト化)

2. EMBERS (ChatGPT APIを用いたヒトマイクロバイオーム論文からの

 メタデータ抽出ツール) 投稿論文用改良 (bioRxiv論文) webアプリ

今後: Microbiome Datahub論文投稿

16 of 23

SIP3 (森, 藤澤)

課題: SIP3(豊かな食が提供される持続可能なフードチェーンの構築)で、

  SIP2の頃に取ったヒトゲノムSNPアレイデータを活用したい

対応: 1. ジャポニカアレイ v.2で約1000人分SNPアレイデータを取得し、

JGAから制限公開済み。hum0397-v1hum0396-v1hum0395-v1

2. 約65万SNPだがimputationされていない。imputationしたいので相談

今後: BioBank Japan 2Kのパネルを使ってTogoImputationをする

17 of 23

LLM vs BioSample (池田、大田、片山、守屋、川島)

課題: LLM で BioSample のターム抽出ができたので論文を書く

対応: 論文のドラフトを書いた�正解セットと抽出用のプロンプトを作成して、Llama 3.1 で抽出

今後: 論文を仕上げる

18 of 23

JoGo haplotype viewer(守屋、VISC)

JoGo の最新の命名規則に沿った variant 表示・比較 Stanza

  • Amino acid:Coding:Transcript:Genebody というしゃれた階層(長崎さん)
    • 各階層で頻度順に ID 付番され並んでいるので、似てるもの同士を比較しにくい
  • ID クリックで下層の展開
  • Variant
    • Clinical significance アリで強調表示
    • mouse over で詳細
    • クリックで TogoVar へ(有れば)
  • Hap.、Var. の頻度情報
  • 各 Level で一致度によるソート
    • ID クリック
    • 今は重みなし

JoGo と TogoVar のサイトに設置?

19 of 23

DDBJ関連(藤澤、河合、丹生)

  • DRA/JGAのメタデータ登録形式の仕様について議論
    • 大規模プロジェクトではメタデータが事前に管理されているが、DRAメタデータ登録が大変だった。手入力を強いる仕様は危険。Sample→Expeiment→Run→Fileの順番にExcelシートが別れているが、手作業で間違いそうだった。
    • ファイルを先にアップロードして、事前に埋める、冗長でもよいので1シートで記述できるとよい。今後、illuminaのレポート形式などの登録形式変換を検討してみる。追記:先進ゲノム支援の配列決定からDRA登録仕様についても調査してみる。
      • PLATFORM PLATFORM_MODEL SampleUID LibraryID フローセルID バーコードID RunIDはファイル記述と同じシートは必須
        • illumina ICAのファイル命名規則などを参考に、{SampleID}-{LilbraryID}_{FlowcellID}_{LaneID}_{read}.fastq.gzの関係情報を埋めたファイル名入力仕様を検討するとよい。PacBio, nanoporeなども。
  • スパコンのインシデント・定期メンテナンス・phase4対応
    • ウェブサービスの棚卸しと運用改善
    • docker → podman
    • UGE/AGE → slurm

20 of 23

NCBI orthologsのRDF化と自動化(千葉・佐藤・川島)

課題

  • NCBI orthologsのRDF化はできていた => RDF化およびロード処理を自動化したい

対応:今回追加した処理

  • NCBIのFTPサーバー上にあるファイルのタイムスタンプを見に行く
  • ローカルに保存してあるファイルより新しかったら、ダウンロードする
  • スクリプトによって、RDF化する
  • NASに置いてあるTurtleファイルを、新しいものに置き換える

今後

  • RDF portalのconfig作成、ロード
  • 更新頻度の検討 (monthly?)

21 of 23

MassBank RDF (岡、西田)

課題:

  • Schema.org -> (RDF portal で)よく使われる語彙に
  • MassBank の ChemicalSubstrance field だけでなく、全 field を RDF 化するように

対応:

  • Schema.org -> dcterms や skos を使うようにした
  • 分析化学、マススペクトルの field は “spectrum generation information MS:1001458” とか “spectrum attribute MS:1000499” といった「もやっと」した語彙を(とりあえず)述語に使って全 field を RDF 化した

今後

  • 川島さん、Steffen Neumann (MassBank EU) にご意見伺い
  • rdf-config の model.yaml 作成

22 of 23

iMethyl RDF(川島・八谷

課題

  • BioHackathon@盛岡(2017年)に始まったが中断していた、iMethyl RDFをrebootして完成させる(BH24.6, Togothon 143の続き)

対応

  • メタデータについて、八谷さんと打ち合わせ
    • テンプレートを作成したので、八谷さんに埋めてもらう
  • 数値データの部分は、変換スクリプトはできている

今後

  • TogoVarなどと統合的に使うためには、GRCh38にLiftoverしないといけない(transannoを試す)

[]

faldo:location [

faldo:begin [

faldo:position 161198 ;

faldo:reference <http://identifiers.org/hco/10/GRCh38> ;

a faldo:ExactPosition

] ;

faldo:end [

faldo:position 161200 ;

faldo:reference <http://identifiers.org/hco/10/GRCh38> ;

a faldo:ExactPosition

] ;

a faldo:Region

] ;

imo:sample imd:femcd4 ;

sio:SIO_000216 [

sio:SIO_000221 imo:Call ;

sio:SIO_000300 53

], [

sio:SIO_000221 sio:SIO_001109 ;

sio:SIO_000300 97.6365603995129

], [

sio:SIO_000221 sio:SIO_001110 ;

sio:SIO_000300 100

], [

sio:SIO_000221 sio:SIO_000770 ;

sio:SIO_000300 2.8447777252689

], [

sio:SIO_000221 imo:RI ;

sio:SIO_000300 7.52895752895751

] ;

a imo:CDMVStat .

23 of 23

TogoVar(三橋、佐藤、野田、永野他)

  • 2024.2 リリースのためのUIを開発しつつ、ステージング環境でレビュー
    • レビュー中:Simplesearch, Advancedsearch
    • 開発中:スタンザ(MGeND, Frequency(JGA-WGS (78サンプル)追加))