Fuentes y licencias
Este sitio se construye con datos abiertos. Aquí está cada fuente, con su licencia y con lo que hemos cambiado respecto al original. Las reglas ortográficas que aplicamos proceden de la Ortografía de la lengua española (RAE y ASALE, 2010); es una obra con derechos, así que la citamos y la seguimos, pero no reproducimos su texto ni rastreamos los sitios de la RAE.
Wikcionario en español
De la edición en español del Wikcionario proceden las divisiones silábicas de referencia con las que contrastamos nuestro motor, la indicación de la pronunciación y la primera acepción que aparece en las páginas de palabra.
- Origen: volcado oficial eswiktionary del 1 de septiembre de 2026.
- Licencia declarada por el propio proyecto: Creative Commons Attribution-Share Alike 4.0 (CC BY-SA 4.0).
- Sitio: es.wiktionary.org
Como el contenido está bajo CC BY-SA 4.0, lo que en este sitio procede del Wikcionario se distribuye bajo esa misma licencia, con atribución. En cada página de palabra, la acepción lleva su enlace al artículo original.
Listas de frecuencia
El orden de importancia de las palabras (qué palabra es más usada que otra) viene de un recuento de frecuencias sobre subtítulos de películas y series.
- Origen: proyecto FrequencyWords de Hermit Dave, lista del español de 2018, construida sobre OpenSubtitles2018.
- Licencia del contenido, citada del propio repositorio: «CC-by-sa-4.0 for content.»
- Sitio: github.com/hermitdave/FrequencyWords
Diccionario ortográfico RLA-ES
Para decidir si una secuencia de letras es realmente una palabra del español usamos el diccionario ortográfico libre RLA-ES, en su versión 2.9, tal y como se distribuye con los diccionarios de LibreOffice (variantes es_ES y es_MX).
- Licencia, citada del archivo del proyecto: el proyecto y los diccionarios se distribuyen bajo un triple esquema de licencias disjuntas, GNU GPL versión 3 o posterior, GNU LGPL versión 3 o posterior o MPL versión 1.1 o posterior.
- Sitio: github.com/sbosio/rla-es
La comprobación ortográfica se hace con spylls 0.1.7, una reimplementación de Hunspell en Python, distribuida bajo la Mozilla Public License 2.0.
Qué cambiamos
Ninguna fuente se publica aquí tal cual. Esto es lo que hacemos con cada una:
- Seleccionamos. Del Wikcionario y de la lista de frecuencias sale un vocabulario común del que se descartan los nombres propios, las siglas, las abreviaturas, los símbolos y las palabras que ningún diccionario reconoce. Cada descarte queda registrado con su motivo.
- Normalizamos la escritura. Todo se guarda en forma Unicode NFC, de modo que dos escrituras distintas de la misma palabra acentuada no aparezcan como dos palabras.
- No copiamos las sílabas. Las divisiones del Wikcionario no se publican: se usan como contraste para medir nuestro motor. Lo que ves en las páginas está calculado con las reglas de la Ortografía, y por eso a veces difiere del Wikcionario, que en ocasiones divide por el origen de la palabra (des-armado) donde la norma divide por el sonido (de-sar-ma-do).
- Marcamos el uso. Las palabras regionales, anticuadas, en desuso, despectivas, malsonantes o tomadas de otra lengua se señalan con su marca cuando el Wikcionario la da para todas sus acepciones, no solo para alguna.
- Recortamos las acepciones. De cada palabra mostramos únicamente la primera acepción, y solo si es breve. El resto del artículo se consulta en el Wikcionario, con el enlace que acompaña al texto.
- No añadimos nada de nuestra cosecha a los datos. Ni definiciones inventadas, ni ejemplos escritos a mano, ni autores, ni cifras redondeadas: los números que aparecen en el sitio se calculan sobre la base de datos en el momento de mostrarlos.
Errores
Si encuentras una división en sílabas, una clasificación o una rima que no cuadra con la norma, es un error nuestro y no de las fuentes: el cálculo es nuestro. En la página de contacto explicamos cómo avisarnos.