Dataset Péptidos: publicamos un dataset abierto de péptidos de investigación.

En Péptidos y Suplementos México creemos en la información abierta y verificable.
Por eso publicamos un dataset abierto de péptidos de investigación en HuggingFace,
la plataforma de datos e inteligencia artificial más usada por la comunidad científica.
El dataset reúne una lista curada de péptidos de investigación (metabólicos,
regenerativos, cosméticos, secretagogos de hormona de crecimiento y más), cada uno
acompañado de propiedades fisicoquímicas verificadas desde PubChem: identificador
CID, fórmula molecular, peso molecular, SMILES canónico y nombre IUPAC.
Es un recurso pensado para investigadores, desarrolladores y estudiantes que necesiten
una referencia normalizada de nombres, alias y estructuras de péptidos para proyectos
de quimioinformática, minería de literatura o aprendizaje automático. Si quieres entender
primero qué son estos compuestos y cómo funcionan a nivel biológico, nuestra
guía introductoria sobre péptidos
es un buen punto de partida antes de explorar el dataset.
¿Qué contiene el dataset y por qué importa?
La quimioinformática moderna depende de datos estructurados y reproducibles. Cuando un
investigador trabaja con un péptido como el MOTS-c 10 mg
—un péptido mitocondrial con propiedades metabólicas documentadas— necesita más que un
nombre comercial: necesita el CID de PubChem, el SMILES canónico y el peso molecular exacto
para poder cruzar referencias con bases de datos como
PubChem
o integrar el compuesto en pipelines de aprendizaje automático.
El dataset cubre las siguientes familias de péptidos de investigación:
- Péptidos regenerativos: compuestos estudiados por su potencial en reparación
tisular y recuperación, como el combo
BPC-157 + TB-500 (10 + 10 mg).
Puedes profundizar en el mecanismo del BPC-157 en nuestro artículo
BPC-157: el péptido de recuperación deportiva
y en TB-500 en la guía
TB-500: el péptido que todo atleta debe conocer. - Péptidos metabólicos: incluye secretagogos de hormona de crecimiento y moléculas
con efecto sobre el metabolismo energético. Para el contexto clínico de los péptidos orientados
a composición corporal, consulta nuestra
guía científica de pérdida de grasa con péptidos. - Péptidos cosméticos y de longevidad: moléculas como el GHK-Cu, ampliamente
referenciadas en literatura de antienvejecimiento. Nuestro artículo sobre
GHK-Cu y regeneración
complementa la entrada del dataset con contexto bibliográfico. - Secretagogos de hormona de crecimiento: péptidos que estimulan la liberación
endógena de GH, como los combinados CJC-1295 / ipamorelina y la sermorelina. - Péptidos nootrópicos e inmunomoduladores: entre ellos el Selank, la timosina
alfa-1 y análogos. Si te interesa el eje ansiedad-cognición, revisa la guía de
Selank: qué es, para qué sirve y dosis.
Estructura de los datos
Cada fila del dataset incluye los siguientes campos normalizados:
- name: nombre más común en la literatura científica.
- aliases: lista de sinónimos, nombres comerciales y variantes ortográficas frecuentes.
- category: clasificación funcional (regenerativo, metabólico, cosmético, etc.).
- pubchem_cid: identificador único en la base de datos
PubChem del NCBI. - molecular_formula: fórmula molecular verificada.
- molecular_weight: peso molecular en g/mol.
- canonical_smiles: representación SMILES canónica para uso en herramientas de quimioinformática.
- iupac_name: nombre sistemático IUPAC completo.
Esta estructura permite integrarlo directamente con bibliotecas como RDKit, DeepChem o
cualquier pipeline de NLP entrenado sobre literatura biomédica. El formato Parquet y CSV
está disponible en la página del dataset.
Casos de uso documentados
El dataset fue diseñado pensando en tres perfiles de usuario principales:
- Investigadores académicos que necesitan una referencia normalizada para
experimentos de minería de texto en PubMed o para entrenar modelos de reconocimiento de
entidades nombradas (NER) sobre literatura de péptidos. La
base de datos MEDLINE/PubMed del NIH
contiene miles de registros sobre estos compuestos, pero carece de un identificador
normalizado cruzado entre nombre comercial, alias y estructura molecular; el dataset
cubre ese vacío. - Desarrolladores de software que construyen aplicaciones de catálogo,
buscadores semánticos o herramientas de comparación molecular y necesitan un ground truth
de identidades químicas verificadas. - Estudiantes de farmacología computacional y bioinformática que buscan
un conjunto de datos real, limpio y con licencia abierta para proyectos académicos o
de fin de grado.
Cómo se verificaron los datos
Cada entrada fue contrastada de forma programática contra la
API REST de PubChem (PUG REST)
usando el nombre o CID como clave primaria. Los campos molecular_formula, molecular_weight,
canonical_smiles e iupac_name provienen directamente de la respuesta de la API, lo que
garantiza reproducibilidad: cualquier usuario puede replicar la consulta con el CID
para verificar o actualizar los valores si PubChem incorpora correcciones futuras.
El proceso de curación incluyó además una revisión manual de los aliases más comunes
en foros científicos, ensayos clínicos registrados en
ClinicalTrials.gov
y hojas de datos de referencia, para asegurarnos de que los sinónimos capturados son los
que realmente aparecen en la literatura primaria.
Relación con el catálogo de Péptidos y Suplementos México
Varios de los compuestos catalogados en el dataset corresponden a péptidos que
documentamos en detalle en nuestro catálogo. Por ejemplo, el
combo BPC-157 + TB-500
entre los regenerativos, o el
MOTS-c
entre los metabólicos. Contrastar la ficha del producto con la entrada del dataset
permite verificar nombre, alias y estructura molecular contra una referencia normalizada
e independiente.
Esta coherencia entre catálogo y dataset es intencional: buscamos que cualquier persona
que llegue a un compuesto por la vía comercial pueda trazarlo de vuelta hasta su identidad
química formal, y viceversa. El artículo sobre
péptidos para longevidad y antienvejecimiento
ilustra bien cómo los datos de estructura molecular respaldan las afirmaciones mecanísticas
que aparecen en la literatura de longevidad.
Acceso y descarga
Puedes consultar y descargar el
dataset abierto de péptidos de investigación
directamente en HuggingFace:
https://huggingface.co/datasets/PeptidosSuplementos/research-peptides-reference
El dataset se publica bajo licencia abierta. Si lo usas en un proyecto, agradecemos
una mención o un enlace al repositorio. Si encuentras algún error o quieres sugerir
un nuevo compuesto, puedes usar la sección de Discussions de HuggingFace o escribirnos
directamente a través de nuestra tienda en línea.
Qué contiene el dataset péptidos que publicamos
El dataset péptidos reúne información estructurada de compuestos de investigación: secuencia, peso molecular, número CAS e identificadores públicos.
Se publicó en abierto para que cualquiera pueda verificar los datos sin depender de fichas comerciales.
Un dataset péptidos de acceso libre reduce la fricción de contrastar lo que dice un proveedor contra fuentes primarias.
Para qué sirve un dataset péptidos abierto
Un dataset péptidos público cumple tres funciones.
Permite verificar identidad y peso molecular sin depender del vendedor.
Facilita comparar fichas técnicas entre proveedores distintos.
Y da un punto de partida citable para quien escribe sobre el tema.
Ese es el motivo de publicar el dataset péptidos en abierto y no como recurso cerrado.
Preguntas frecuentes
¿Para qué sirve un dataset de péptidos de investigación?
Permite a investigadores, desarrolladores y estudiantes disponer de una referencia
normalizada de nombres, alias, fórmulas moleculares y estructuras SMILES verificadas
desde PubChem. Es útil para proyectos de quimioinformática, minería de literatura
biomédica, entrenamiento de modelos de lenguaje especializados y comparación de
identidades químicas entre fuentes distintas.
¿Cómo se verificaron los datos del dataset?
Cada campo fisicoquímico (fórmula molecular, peso molecular, SMILES canónico y nombre
IUPAC) fue extraído de forma programática mediante la API REST de PubChem usando el CID
como identificador primario. La lista de aliases se contrastó además con registros de
ClinicalTrials.gov y literatura primaria para capturar los sinónimos más usados en
contextos científicos reales.
¿Qué tipos de péptidos incluye el dataset?
El dataset cubre péptidos regenerativos (como BPC-157 y TB-500), metabólicos (como
MOTS-c), cosméticos y de longevidad (como GHK-Cu), secretagogos de hormona de crecimiento
(como CJC-1295, ipamorelina y sermorelina) y péptidos nootrópicos e inmunomoduladores
(como Selank y timosina alfa-1), entre otras categorías.
¿Puedo usar el dataset en un proyecto académico o comercial?
Sí. El dataset se publica bajo licencia abierta en HuggingFace. Se agradece una
mención o enlace al repositorio si lo utilizas en un proyecto publicado. Para usos
comerciales que requieran condiciones específicas, consulta los términos de la licencia
en la página del dataset.
¿Con qué frecuencia se actualiza el dataset?
El dataset se actualiza de forma periódica a medida que incorporamos nuevos compuestos
al catálogo o cuando PubChem publica correcciones en los registros existentes. La fecha
de la última actualización está visible en la página de HuggingFace del repositorio.
¿El dataset incluye información de dosificación o uso clínico?
No. El dataset es estrictamente de carácter fisicoquímico y de clasificación funcional.
No incluye dosis, protocolos ni recomendaciones de uso. Para contexto clínico y
bibliográfico de cada compuesto, consulta los artículos del blog y la literatura
primaria referenciada en ellos.
Nota: este material es de carácter informativo y educativo (uso en investigación,
RUO). No constituye consejo médico ni recomendación de uso. Consulta siempre la
literatura primaria y a profesionales calificados.
