Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Variant Effect Coding
Texto

Variant Effect Coding

Conjunto de datos bioinformáticos de más de 50 000 mutaciones genéticas anotadas, que permite entrenar modelos para la clasificación de variantes patógenas frente a variantes benignas.

Obtén el dataset
Tamaño

50.083 entradas, 102 MB, formato parquet

Licencia

Apache 2.0

Descripción

Variant Effect Coding es un conjunto de datos estructurado para bioinformática que contiene más de 50 000 variantes genéticas. Proviene de la fusión de datos de ClinVar (variantes patógenas) y GnomAD (variantes benignas de alta frecuencia). Los datos están organizados por cromosomas y listos para las tareas de clasificación supervisadas.

¿Para qué sirve este conjunto de datos?

  • Formación de modelos de aprendizaje supervisado para la detección de mutaciones genéticas patógenas
  • Probando las arquitecturas de LLMs aplicadas a la genómica
  • Exploración de enfoques de razonamiento biológico multimodal basados en codones y anotaciones

¿Se puede enriquecer o mejorar?

Sí, este conjunto de datos se puede enriquecer añadiendo otros tipos de variantes, anotaciones funcionales o incluso cruzándolo con datos clínicos. También es posible añadir representaciones vectoriales a partir de modelos como DNA-BERT u otros LLM orgánicos.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐⭐ (Muy simple de cargar vía la librería Hugging Face)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Ninguna limpieza necesaria)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐⭐ (Codones anotados, clasificados y etiquetados)
📜 Licencia comercial✅ Sí (Apache 2.0)
👨‍💻 Ideal para principiantes🌟 Perfecto para empezar en clasificación biológica
🔁 Reutilizable para fine-tuning🎯 Sí, para modelos biológicos (DNA-BERT, BioGPT…)
🌍 Diversidad culturalN/A No aplicable – datos estrictamente biológicos

🧠 Recomendado para

  • Investigadores genéticos
  • Ingenieros bioinformáticos
  • Proyectos de AI/DNA

🔧 Herramientas compatibles

  • Hugging Face Datasets
  • Scikit-learn
  • PyTorch
  • DNA-BERT
  • BioBERT

💡 Consejo

Para maximizar el rendimiento, pruebe la codificación especial de las secuencias antes de ajustarlas (por ejemplo, la tokenización de k-mer).

Preguntas frecuentes

¿Este conjunto de datos incluye secuencias de ADN completas?

No, se trata de variantes genéticas precisas con anotaciones, no de secuencias genómicas completas.

¿Se puede usar este conjunto de datos para detectar nuevas mutaciones?

No directamente, pero es perfecto para entrenar un modelo que luego podría generalizarse a casos nuevos.

¿Es adecuado para la formación con LLM especializados en biología?

Sí, se ha utilizado en investigaciones recientes sobre el entrenamiento de LLM de ADN multimodales.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.