NovoMCP Open Corpus (lite)

chemistry drug discovery life sciences machine learning molecule parquet pharmaceutical

Description

122,454,458 PubChem compounds with RDKit physicochemical descriptors, ~30 ADMET/toxicity predictions (NovoMCP models, trained on the public Therapeutics Data Commons benchmark), and PAINS structural-alert flags. One row per PubChem CID, stored as Apache Parquet (Snappy) for direct in-place querying (Athena, DuckDB, PyArrow, pandas). An analysis-ready cheminformatics substrate for drug discovery: virtual screening, drug-likeness (QED) filtering, similarity search, chemical-space exploration, and training ADMET models at scale — so you don't recompute descriptors and property predictions across all of PubChem yourself. Computed properties and model predictions for research use — not experimental measurements or regulatory determinations.

Update Frequency

Static release; refreshed periodically as models improve (versioned).

License

CC-BY-4.0 (https://creativecommons.org/licenses/by/4.0/)

Documentation

https://github.com/NovoMCP/open-data-examples/tree/main/novomcp-open-corpus-lite

Managed By

NovoMCP

See all datasets managed by NovoMCP.

Contact

https://github.com/NovoMCP/novomcp/issues

How to Cite

NovoMCP Open Corpus (lite) was accessed on DATE from https://registry.opendata.aws/novomcp-open-corpus-lite.

Usage Examples

Tutorials
Tools & Applications
Publications

Resources on AWS

  • Description
    Parquet shards (1409 files, 27.4 GB, 122,454,458 rows x 59 columns)
    Resource type
    S3 Bucket
    Amazon Resource Name (ARN)
    arn:aws:s3:::novomcp-open-corpus/novomcp-open-corpus-lite/
    AWS Region
    us-east-2
    AWS CLI Access (No AWS account required)
    aws s3 ls --no-sign-request s3://novomcp-open-corpus/novomcp-open-corpus-lite/

Edit this dataset entry on GitHub

Tell us about your project

Home