chemistry drug discovery life sciences machine learning molecule parquet pharmaceutical
122,454,458 PubChem compounds with RDKit physicochemical descriptors, ~30 ADMET/toxicity predictions (NovoMCP models, trained on the public Therapeutics Data Commons benchmark), and PAINS structural-alert flags. One row per PubChem CID, stored as Apache Parquet (Snappy) for direct in-place querying (Athena, DuckDB, PyArrow, pandas). An analysis-ready cheminformatics substrate for drug discovery: virtual screening, drug-likeness (QED) filtering, similarity search, chemical-space exploration, and training ADMET models at scale — so you don't recompute descriptors and property predictions across all of PubChem yourself. Computed properties and model predictions for research use — not experimental measurements or regulatory determinations.
Static release; refreshed periodically as models improve (versioned).
CC-BY-4.0 (https://creativecommons.org/licenses/by/4.0/)
https://github.com/NovoMCP/open-data-examples/tree/main/novomcp-open-corpus-lite
See all datasets managed by NovoMCP.
https://github.com/NovoMCP/novomcp/issues
NovoMCP Open Corpus (lite) was accessed on DATE from https://registry.opendata.aws/novomcp-open-corpus-lite.
arn:aws:s3:::novomcp-open-corpus/novomcp-open-corpus-lite/us-east-2aws s3 ls --no-sign-request s3://novomcp-open-corpus/novomcp-open-corpus-lite/