Catalog

Models

Browse model families and checkpoints, then filter by group or available output: embeddings, likelihood scores, or predicted tracks.

Model families
35
Model versions
103
RNA models
17
DNA models
12
Sequence-to-function
3
Baselines
3

Gated access: NucleotideTransformerV3 requires model access on Hugging Face and an authenticated hf auth login.

Evo2: hardware varies by checkpoint. The 7B port uses bfloat16, while the 1B, 20B, and 40B Transformer Engine ports require Hopper-class GPUs. The 20B and 40B checkpoints require multiple H100-class devices. Expand Evo2 below and open the selected version's checkpoint card before allocating hardware.

Hardware and input requirements vary by checkpoint. Check the adapter and checkpoint card for memory, context length, attention backend, and required sequence tracks before a large run.

35 families shown

RNA model

AIDO.RNA

Masked-language RNA model family with standard, CDS-adapted, and MARS pre-training variants.

Available outputsEmbeddingPseudo-likelihood
7 versions
AIDO.RNA-650MEmbeddingPseudo-likelihoodAIDO.RNA-650M-CDSdefaultEmbeddingPseudo-likelihoodAIDO.RNA-1.6BEmbeddingPseudo-likelihoodAIDO.RNA-1.6B-CDSEmbeddingPseudo-likelihoodAIDO.RNA-1M-MARSEmbeddingPseudo-likelihoodAIDO.RNA-25M-MARSEmbeddingPseudo-likelihoodAIDO.RNA-300M-MARSEmbeddingPseudo-likelihood
RNA model

CodonBERT

Codon-tokenized model trained on coding regions from mammalian, bacterial, and viral mRNAs.

Available outputsEmbeddingPseudo-likelihood
1 version
CodonBERTdefaultEmbeddingPseudo-likelihood
RNA model

ERNIE-RNA

RNA Transformer with an attention bias designed around base-pairing structure.

Available outputsEmbeddingPseudo-likelihood
3 versions
ERNIE-RNAdefaultEmbeddingPseudo-likelihoodERNIE-RNA-SSEmbeddingPseudo-likelihoodERNIE-RNA-MRLEmbeddingPseudo-likelihood
RNA model

Helix-mRNA

Hybrid Mamba2 and Transformer model with coding-region-aware tokenization.

Available outputsEmbedding
1 version
helix-mrnadefaultEmbedding
RNA model

mRNABERT

mRNA language model with masked-token and transcript-to-protein contrastive training.

Available outputsEmbeddingPseudo-likelihood
1 version
mRNABERTdefaultEmbeddingPseudo-likelihood
RNA model

mRNA-FM

Codon-tokenized model trained on coding regions and evaluated with a required CDS track.

Available outputsEmbeddingPseudo-likelihood
1 version
mRNA-FMdefaultEmbeddingPseudo-likelihood
RNA model

OmniGenome

Plant RNA model trained with sequence reconstruction and structure-aware objectives.

Available outputsEmbeddingPseudo-likelihood
2 versions
omnigenome-52mEmbeddingPseudo-likelihoodomnigenome-186mdefaultEmbeddingPseudo-likelihood
RNA model

Orthrus

Mamba-based transcript model trained contrastively on functional and evolutionary relationships.

Available outputsEmbedding
3 versions
orthrus-base-4-trackEmbeddingorthrus-large-4-trackEmbeddingorthrus-large-6-trackdefaultEmbedding
RNA model

Plant-RNAFM

Plant RNA model trained across species with sequence, structure, and region-annotation objectives.

Available outputsEmbeddingPseudo-likelihood
1 version
plant_rnafmdefaultEmbeddingPseudo-likelihood
RNA model

RiNALMo

Masked RNA language model family with rotary positional encoding.

Available outputsEmbeddingPseudo-likelihood
3 versions
RiNALMo-microEmbeddingPseudo-likelihoodRiNALMo-megadefaultEmbeddingPseudo-likelihoodRiNALMo-gigaEmbeddingPseudo-likelihood
RNA model

RNABERT

RNA Transformer trained with masked-token prediction and structural alignment.

Available outputsEmbeddingPseudo-likelihood
1 version
RNABERTdefaultEmbeddingPseudo-likelihood
RNA model

RNAErnie

RNA language model using motif-level contiguous masking.

Available outputsEmbeddingPseudo-likelihood
2 versions
RNAErniedefaultEmbeddingPseudo-likelihoodRNAErnie2EmbeddingPseudo-likelihood
RNA model

RNA-FM

Transformer trained with masked-token prediction across a large non-coding RNA collection.

Available outputsEmbeddingPseudo-likelihood
1 version
RNA-FMdefaultEmbeddingPseudo-likelihood
RNA model

RNA-MSM

Structure-aware RNA model trained from multiple-sequence alignments.

Available outputsEmbeddingPseudo-likelihood
1 version
RNA-MSMdefaultEmbeddingPseudo-likelihood
RNA model

SpliceBERT

Masked RNA model trained on vertebrate transcripts with a focus on splice-site sequence.

Available outputsEmbeddingPseudo-likelihood
3 versions
SpliceBERT-1024ntdefaultEmbeddingPseudo-likelihoodSpliceBERT-510ntEmbeddingPseudo-likelihoodSpliceBERT-human-510ntEmbeddingPseudo-likelihood
RNA model

3UTRBERT

3' UTR language model family using overlapping k-mer tokenization.

Available outputsEmbeddingPseudo-likelihood
4 versions
UTRBERT-3merEmbeddingPseudo-likelihoodUTRBERT-4merEmbeddingPseudo-likelihoodUTRBERT-5merEmbeddingPseudo-likelihoodUTRBERT-6merdefaultEmbeddingPseudo-likelihood
RNA model

UTR-LM

5' UTR model family trained on random and endogenous UTR sequences.

Available outputsEmbeddingPseudo-likelihood
4 versions
UTR-LM-MLMSIdefaultEmbeddingPseudo-likelihoodUTR-LM-MLMSISSEmbeddingPseudo-likelihoodUTR-LM-MLMEmbeddingPseudo-likelihoodUTR-LM-MLMSSEmbeddingPseudo-likelihood
DNA model

AIDO.DNA

Bidirectional DNA language model with embedding and masked-token pseudo-likelihood interfaces.

Available outputsEmbeddingPseudo-likelihood
2 versions
AIDO.DNA-300MdefaultEmbeddingPseudo-likelihoodAIDO.DNA-7BEmbeddingPseudo-likelihood
Sequence-to-function model

AlphaGenome

Long-context sequence-to-function model that predicts genomic activity tracks.

Available outputsEmbeddingTrack prediction
1 version
alphagenomedefaultEmbeddingTrack prediction
Sequence-to-function model

Borzoi

Long-window sequence-to-function model for RNA-seq and regulatory tracks, including Flashzoi variants.

Available outputsEmbeddingTrack prediction
10 versions
borzoi-replicate-0EmbeddingTrack predictionborzoi-replicate-1EmbeddingTrack predictionborzoi-replicate-2EmbeddingTrack predictionborzoi-replicate-3EmbeddingTrack predictionflashzoi-replicate-0EmbeddingTrack predictionflashzoi-replicate-1EmbeddingTrack predictionflashzoi-replicate-2EmbeddingTrack predictionflashzoi-replicate-3EmbeddingTrack predictionborzoiEmbeddingTrack predictionflashzoidefaultEmbeddingTrack prediction
DNA model

Carbon

Autoregressive genomic model trained on eukaryotic genes, mature mRNA, and bacterial genomes.

Available outputsEmbeddingCausal likelihood
3 versions
Carbon-500MEmbeddingCausal likelihoodCarbon-3BdefaultEmbeddingCausal likelihoodCarbon-8BEmbeddingCausal likelihood
DNA model

DNABERT

Original masked DNA Transformer family with overlapping k-mer tokenization.

Available outputsEmbeddingPseudo-likelihood
4 versions
DNABERT-3merEmbeddingPseudo-likelihoodDNABERT-4merEmbeddingPseudo-likelihoodDNABERT-5merEmbeddingPseudo-likelihoodDNABERT-6merdefaultEmbeddingPseudo-likelihood
DNA model

DNABERT-S

Species-aware DNA model trained contrastively across microbial genomes.

Available outputsEmbedding
1 version
DNABERT-SdefaultEmbedding
DNA model

DNABERT2

Multi-species masked DNA model with byte-pair tokenization and rotary positions.

Available outputsEmbeddingPseudo-likelihood
1 version
DNABERT2defaultEmbeddingPseudo-likelihood
Sequence-to-function model

Enformer

Long-range sequence-to-function model for RNA-seq, ATAC-seq, and ChIP-seq tracks.

Available outputsEmbeddingTrack prediction
1 version
enformer-official-roughdefaultEmbeddingTrack prediction
DNA model

Evo1

Autoregressive StripedHyena genomic model with short and long context variants.

Available outputsEmbeddingCausal likelihood
3 versions
Evo1-1.5-7B-8KdefaultEmbeddingCausal likelihoodEvo1-1-7B-8KEmbeddingCausal likelihoodEvo1-1-7B-131KEmbeddingCausal likelihood
DNA model

Evo2

Autoregressive StripedHyena2 family trained on OpenGenome2 with context lengths up to one million nucleotides.

Available outputsEmbeddingCausal likelihood
7 versions
Evo2-1B-8KEmbeddingCausal likelihoodEvo2-7B-8KdefaultEmbeddingCausal likelihoodEvo2-7B-262KEmbeddingCausal likelihoodEvo2-7B-1MEmbeddingCausal likelihoodEvo2-20B-1MEmbeddingCausal likelihoodEvo2-40B-8KEmbeddingCausal likelihoodEvo2-40B-1MEmbeddingCausal likelihood
DNA model

GENERanno

Bidirectional genomic model family with base and coding-sequence annotator variants.

Available outputsEmbeddingPseudo-likelihood
4 versions
prokaryote-0.5b-baseEmbeddingPseudo-likelihoodprokaryote-0.5b-cds-annotatorEmbeddingeukaryote-0.5b-basedefaultEmbeddingPseudo-likelihoodeukaryote-1.2b-cds-annotator-previewEmbedding
DNA model

GENERator

Autoregressive gene-region model family with eukaryotic and prokaryotic checkpoints.

Available outputsEmbeddingCausal likelihood
6 versions
eukaryote-1.2b-baseEmbeddingCausal likelihoodv2-eukaryote-1.2b-baseEmbeddingCausal likelihoodv2-prokaryote-1.2b-baseEmbeddingCausal likelihoodeukaryote-3b-baseEmbeddingCausal likelihoodv2-eukaryote-3b-basedefaultEmbeddingCausal likelihoodv2-prokaryote-3b-baseEmbeddingCausal likelihood
DNA model

HyenaDNA

Long-context genomic language model with checkpoints spanning 16 thousand to one million nucleotides.

Available outputsEmbeddingCausal likelihood
5 versions
hyenadna-large-1m-seqlen-hfEmbeddingCausal likelihoodhyenadna-medium-450k-seqlen-hfdefaultEmbeddingCausal likelihoodhyenadna-medium-160k-seqlen-hfEmbeddingCausal likelihoodhyenadna-small-32k-seqlen-hfEmbeddingCausal likelihoodhyenadna-tiny-16k-seqlen-d128-hfEmbeddingCausal likelihood
DNA model

NucleotideTransformer

Masked DNA Transformer family spanning human-reference and multi-species pre-training sets.

Available outputsEmbeddingPseudo-likelihood
8 versions
2.5b-multi-speciesdefaultEmbeddingPseudo-likelihood2.5b-1000gEmbeddingPseudo-likelihood500m-human-refEmbeddingPseudo-likelihood500m-1000gEmbeddingPseudo-likelihoodv2-50m-multi-speciesEmbeddingPseudo-likelihoodv2-100m-multi-speciesEmbeddingPseudo-likelihoodv2-250m-multi-speciesEmbeddingPseudo-likelihoodv2-500m-multi-speciesEmbeddingPseudo-likelihood
DNA model

NucleotideTransformerV3

Single-nucleotide, long-sequence model with checkpoints from sequence pretraining and genomic-track post-training.

Available outputsEmbeddingPseudo-likelihoodTrack prediction
5 versions
v3_8M_preEmbeddingPseudo-likelihoodv3_100M_preEmbeddingPseudo-likelihoodv3_650M_preEmbeddingPseudo-likelihoodv3_100M_postEmbeddingTrack predictionv3_650M_postdefaultEmbeddingTrack prediction
Baseline

NaiveBaseline

Fixed k-mer count, GC-content, and sequence-statistic features.

Available outputsEmbedding
1 version
naive-4-trackdefaultEmbedding
Baseline

NaiveBaselineSixTrack

Naive sequence features augmented with coding-region length and exon count.

Available outputsEmbedding
1 version
naive-6-trackdefaultEmbedding
Baseline

NaiveMamba

Randomly initialized six-track Mamba model used as an untrained reference.

Available outputsEmbedding
1 version
naive-mambadefaultEmbedding