RNA model
AIDO.RNA
Masked-language RNA model family with standard, CDS-adapted, and MARS pre-training variants.
Available outputsEmbeddingPseudo-likelihood
7 versions
AIDO.RNA-650MEmbeddingPseudo-likelihoodAIDO.RNA-650M-CDSdefaultEmbeddingPseudo-likelihoodAIDO.RNA-1.6BEmbeddingPseudo-likelihoodAIDO.RNA-1.6B-CDSEmbeddingPseudo-likelihoodAIDO.RNA-1M-MARSEmbeddingPseudo-likelihoodAIDO.RNA-25M-MARSEmbeddingPseudo-likelihoodAIDO.RNA-300M-MARSEmbeddingPseudo-likelihood
RNA model
CodonBERT
Codon-tokenized model trained on coding regions from mammalian, bacterial, and viral mRNAs.
Available outputsEmbeddingPseudo-likelihood
1 version
CodonBERTdefaultEmbeddingPseudo-likelihood
RNA model
ERNIE-RNA
RNA Transformer with an attention bias designed around base-pairing structure.
Available outputsEmbeddingPseudo-likelihood
3 versions
ERNIE-RNAdefaultEmbeddingPseudo-likelihoodERNIE-RNA-SSEmbeddingPseudo-likelihoodERNIE-RNA-MRLEmbeddingPseudo-likelihood
RNA model
Helix-mRNA
Hybrid Mamba2 and Transformer model with coding-region-aware tokenization.
Available outputsEmbedding
1 version
helix-mrnadefaultEmbedding
RNA model
mRNABERT
mRNA language model with masked-token and transcript-to-protein contrastive training.
Available outputsEmbeddingPseudo-likelihood
1 version
mRNABERTdefaultEmbeddingPseudo-likelihood
RNA model
mRNA-FM
Codon-tokenized model trained on coding regions and evaluated with a required CDS track.
Available outputsEmbeddingPseudo-likelihood
1 version
mRNA-FMdefaultEmbeddingPseudo-likelihood
RNA model
OmniGenome
Plant RNA model trained with sequence reconstruction and structure-aware objectives.
Available outputsEmbeddingPseudo-likelihood
2 versions
omnigenome-52mEmbeddingPseudo-likelihoodomnigenome-186mdefaultEmbeddingPseudo-likelihood
RNA model
Orthrus
Mamba-based transcript model trained contrastively on functional and evolutionary relationships.
Available outputsEmbedding
3 versions
orthrus-base-4-trackEmbeddingorthrus-large-4-trackEmbeddingorthrus-large-6-trackdefaultEmbedding
RNA model
Plant-RNAFM
Plant RNA model trained across species with sequence, structure, and region-annotation objectives.
Available outputsEmbeddingPseudo-likelihood
1 version
plant_rnafmdefaultEmbeddingPseudo-likelihood
RNA model
RiNALMo
Masked RNA language model family with rotary positional encoding.
Available outputsEmbeddingPseudo-likelihood
3 versions
RiNALMo-microEmbeddingPseudo-likelihoodRiNALMo-megadefaultEmbeddingPseudo-likelihoodRiNALMo-gigaEmbeddingPseudo-likelihood
RNA model
RNABERT
RNA Transformer trained with masked-token prediction and structural alignment.
Available outputsEmbeddingPseudo-likelihood
1 version
RNABERTdefaultEmbeddingPseudo-likelihood
RNA model
RNAErnie
RNA language model using motif-level contiguous masking.
Available outputsEmbeddingPseudo-likelihood
2 versions
RNAErniedefaultEmbeddingPseudo-likelihoodRNAErnie2EmbeddingPseudo-likelihood
RNA model
RNA-FM
Transformer trained with masked-token prediction across a large non-coding RNA collection.
Available outputsEmbeddingPseudo-likelihood
1 version
RNA-FMdefaultEmbeddingPseudo-likelihood
RNA model
RNA-MSM
Structure-aware RNA model trained from multiple-sequence alignments.
Available outputsEmbeddingPseudo-likelihood
1 version
RNA-MSMdefaultEmbeddingPseudo-likelihood
RNA model
SpliceBERT
Masked RNA model trained on vertebrate transcripts with a focus on splice-site sequence.
Available outputsEmbeddingPseudo-likelihood
3 versions
SpliceBERT-1024ntdefaultEmbeddingPseudo-likelihoodSpliceBERT-510ntEmbeddingPseudo-likelihoodSpliceBERT-human-510ntEmbeddingPseudo-likelihood
RNA model
3UTRBERT
3' UTR language model family using overlapping k-mer tokenization.
Available outputsEmbeddingPseudo-likelihood
4 versions
UTRBERT-3merEmbeddingPseudo-likelihoodUTRBERT-4merEmbeddingPseudo-likelihoodUTRBERT-5merEmbeddingPseudo-likelihoodUTRBERT-6merdefaultEmbeddingPseudo-likelihood
RNA model
UTR-LM
5' UTR model family trained on random and endogenous UTR sequences.
Available outputsEmbeddingPseudo-likelihood
4 versions
UTR-LM-MLMSIdefaultEmbeddingPseudo-likelihoodUTR-LM-MLMSISSEmbeddingPseudo-likelihoodUTR-LM-MLMEmbeddingPseudo-likelihoodUTR-LM-MLMSSEmbeddingPseudo-likelihood
DNA model
AIDO.DNA
Bidirectional DNA language model with embedding and masked-token pseudo-likelihood interfaces.
Available outputsEmbeddingPseudo-likelihood
2 versions
AIDO.DNA-300MdefaultEmbeddingPseudo-likelihoodAIDO.DNA-7BEmbeddingPseudo-likelihood
Sequence-to-function model
AlphaGenome
Long-context sequence-to-function model that predicts genomic activity tracks.
Available outputsEmbeddingTrack prediction
1 version
alphagenomedefaultEmbeddingTrack prediction
Sequence-to-function model
Borzoi
Long-window sequence-to-function model for RNA-seq and regulatory tracks, including Flashzoi variants.
Available outputsEmbeddingTrack prediction
10 versions
borzoi-replicate-0EmbeddingTrack predictionborzoi-replicate-1EmbeddingTrack predictionborzoi-replicate-2EmbeddingTrack predictionborzoi-replicate-3EmbeddingTrack predictionflashzoi-replicate-0EmbeddingTrack predictionflashzoi-replicate-1EmbeddingTrack predictionflashzoi-replicate-2EmbeddingTrack predictionflashzoi-replicate-3EmbeddingTrack predictionborzoiEmbeddingTrack predictionflashzoidefaultEmbeddingTrack prediction
DNA model
Carbon
Autoregressive genomic model trained on eukaryotic genes, mature mRNA, and bacterial genomes.
Available outputsEmbeddingCausal likelihood
3 versions
Carbon-500MEmbeddingCausal likelihoodCarbon-3BdefaultEmbeddingCausal likelihoodCarbon-8BEmbeddingCausal likelihood
DNA model
DNABERT
Original masked DNA Transformer family with overlapping k-mer tokenization.
Available outputsEmbeddingPseudo-likelihood
4 versions
DNABERT-3merEmbeddingPseudo-likelihoodDNABERT-4merEmbeddingPseudo-likelihoodDNABERT-5merEmbeddingPseudo-likelihoodDNABERT-6merdefaultEmbeddingPseudo-likelihood
DNA model
DNABERT-S
Species-aware DNA model trained contrastively across microbial genomes.
Available outputsEmbedding
1 version
DNABERT-SdefaultEmbedding
DNA model
DNABERT2
Multi-species masked DNA model with byte-pair tokenization and rotary positions.
Available outputsEmbeddingPseudo-likelihood
1 version
DNABERT2defaultEmbeddingPseudo-likelihood
Sequence-to-function model
Enformer
Long-range sequence-to-function model for RNA-seq, ATAC-seq, and ChIP-seq tracks.
Available outputsEmbeddingTrack prediction
1 version
enformer-official-roughdefaultEmbeddingTrack prediction
DNA model
Evo1
Autoregressive StripedHyena genomic model with short and long context variants.
Available outputsEmbeddingCausal likelihood
3 versions
Evo1-1.5-7B-8KdefaultEmbeddingCausal likelihoodEvo1-1-7B-8KEmbeddingCausal likelihoodEvo1-1-7B-131KEmbeddingCausal likelihood
DNA model
Evo2
Autoregressive StripedHyena2 family trained on OpenGenome2 with context lengths up to one million nucleotides.
Available outputsEmbeddingCausal likelihood
7 versions
DNA model
GENERanno
Bidirectional genomic model family with base and coding-sequence annotator variants.
Available outputsEmbeddingPseudo-likelihood
4 versions
prokaryote-0.5b-baseEmbeddingPseudo-likelihoodprokaryote-0.5b-cds-annotatorEmbeddingeukaryote-0.5b-basedefaultEmbeddingPseudo-likelihoodeukaryote-1.2b-cds-annotator-previewEmbedding
DNA model
GENERator
Autoregressive gene-region model family with eukaryotic and prokaryotic checkpoints.
Available outputsEmbeddingCausal likelihood
6 versions
eukaryote-1.2b-baseEmbeddingCausal likelihoodv2-eukaryote-1.2b-baseEmbeddingCausal likelihoodv2-prokaryote-1.2b-baseEmbeddingCausal likelihoodeukaryote-3b-baseEmbeddingCausal likelihoodv2-eukaryote-3b-basedefaultEmbeddingCausal likelihoodv2-prokaryote-3b-baseEmbeddingCausal likelihood
DNA model
HyenaDNA
Long-context genomic language model with checkpoints spanning 16 thousand to one million nucleotides.
Available outputsEmbeddingCausal likelihood
5 versions
hyenadna-large-1m-seqlen-hfEmbeddingCausal likelihoodhyenadna-medium-450k-seqlen-hfdefaultEmbeddingCausal likelihoodhyenadna-medium-160k-seqlen-hfEmbeddingCausal likelihoodhyenadna-small-32k-seqlen-hfEmbeddingCausal likelihoodhyenadna-tiny-16k-seqlen-d128-hfEmbeddingCausal likelihood
DNA model
NucleotideTransformer
Masked DNA Transformer family spanning human-reference and multi-species pre-training sets.
Available outputsEmbeddingPseudo-likelihood
8 versions
2.5b-multi-speciesdefaultEmbeddingPseudo-likelihood2.5b-1000gEmbeddingPseudo-likelihood500m-human-refEmbeddingPseudo-likelihood500m-1000gEmbeddingPseudo-likelihoodv2-50m-multi-speciesEmbeddingPseudo-likelihoodv2-100m-multi-speciesEmbeddingPseudo-likelihoodv2-250m-multi-speciesEmbeddingPseudo-likelihoodv2-500m-multi-speciesEmbeddingPseudo-likelihood
DNA model
NucleotideTransformerV3
Single-nucleotide, long-sequence model with checkpoints from sequence pretraining and genomic-track post-training.
Available outputsEmbeddingPseudo-likelihoodTrack prediction
5 versions
Baseline
NaiveBaseline
Fixed k-mer count, GC-content, and sequence-statistic features.
Available outputsEmbedding
1 version
naive-4-trackdefaultEmbedding
mRNABench baseline
Baseline
NaiveBaselineSixTrack
Naive sequence features augmented with coding-region length and exon count.
Available outputsEmbedding
1 version
naive-6-trackdefaultEmbedding
mRNABench baseline
Baseline
NaiveMamba
Randomly initialized six-track Mamba model used as an untrained reference.
Available outputsEmbedding
1 version
naive-mambadefaultEmbedding
mRNABench baseline