Mostrando entradas con la etiqueta Proceso de Datos. Mostrar todas las entradas
Mostrando entradas con la etiqueta Proceso de Datos. Mostrar todas las entradas

domingo, 4 de agosto de 2019

Coeficiente Alfa ordinal en R

Frecuentemente vemos que cuando se intenta obtener la fiabilidad de una escala se utiliza el estadístico conocido como alfa de Cronbach. No obstante, este uso tan generalizado puede tener objeciones (Osburn, 2000; Gadermann, Guhn, & Zumbo, 2012; Contreras y Novoa-Muñoz, 2018), cuando la escala de medida usada es ordinal (Elosua y Zumbo,2008), como puede ser en el uso de items likert, ya que uno de los supuestos del estadístico es la naturaleza continua de los datos. 

Cuando esto ocurre podemos usar como estadísticos alternativos tanto Omega ordinal (Dunn, Baguley & Brunsden, 2014; Viladrich, Angulo-Brunet and Doval, 2017) como el alfa ordinal de Cronbach (Contreras y Novoa-Muñoz, 2018), pudiendo dar tanto a una infraestimación como sobreestimación de los resultados respecto al estadístico clásico.

martes, 28 de agosto de 2018

Transformación entre percentiles y puntuaciones z en SPSS

Los estadísticos clásicos de posición en el campo de las Ciencias del Comportamiento, como es el percentil (Galton, 1885),  aún siguen siendo una herramienta que frecuente vemos en la literatura actual. Siendo útil tener siempre herramientas informáticas que nos apoyen en la labor de trabajo e investigación.

De todas ellas veremos en este breve ejemplo, la forma de obtener la puntuación Z o percentil a partir del otro valor. Es decir, cómo teniendo una Z podemos obtener la equivalente del percentil, o bien, dado un percentil averiguar el valor Z correspondiente. Y para ello usaremos el paquete estadístico SPSS.

lunes, 25 de junio de 2018

Visualización de datos en escalas likert (SPSS: jitter plot)

Cuando deseamos representar la relación en una nube de puntos, y las variables están en escala ordinal, con valores enteros, como son los ítems de una escala likert, vemos que es muy difícil ver realmente como se asocian los puntos en el espacio. Una forma de resolver este problema lo vamos a ver a continuación, y se conoce como efecto “jitter”, consistente en restar o sumar una pequeña cantidad arbitraria a la posición del punto en el espacio. De tal forma que si redondeamos los nuevos datos, estos deberán volver a los valores originales.

Esta pequeña alteración, que funciona como un modificador visual de la colisión de datos,  en el SPSS 25 se resuelve por sintaxis.

martes, 16 de mayo de 2017

Minería de Datos en Psicología: Introducción al algoritmo C5

El procedimiento de análisis secuencial C5, destinado a crear árboles de decisión (conjunto de reglas), fué desarrollado por Quinlan (Chambers, & Dinsmore, 2014). Facilitando la interpretación de las decisiones, así como la comprensión de las reglas usadas, a la vez que reduce el número de variables independientes en los modelos explicativos (Pérez, 2011).

Este algoritmo es el resultado de la actualización de algoritmos ID3 y C4.5 (Quinlan & Kaufmann, 1993). Se caracteriza por dividir en subconjuntos, cada vez más pequeños, los datos de partida. Consiguiendo con esta estrategia elaborar reglas de extracción adecuadas a la hora de predecir de forma óptima un objetivo (Quinlan, 2014). Para ello se sirve de índices como "Gain Ratio" (razón entre la ganancia de información y la ganancia intrínseca) que es una modificación destinada a reducir el sesgo de la ganancia de información.

domingo, 13 de noviembre de 2016

Procedimiento de correlaciones heterogéneas en SPSS 24

En ciertas situaciones la naturaleza de las variables no permite el uso de la correlación de Pearson, o sus algoritmos asociados. Para este tipo de situaciones el SPSS 24 (IBM Corp., 2016) contempla módulos integrados en R como el que vamos a describir en esta entrada brevemente.

Este procedimiento extendido de las correlaciones heterogéneas requiere, además del modulo IBM SPSS Statistics, los complementos de integración para R como para Python.

miércoles, 6 de julio de 2016

Procedimiento DETECTANOMALY en SPSS 24

El proceso de análisis de datos que describimos "Detectanomaly", se puede encontrar en distintas versiones del SPSS, en nuestro caso corresponde con la versión 24. Este procedimiento permite identificar los valores "anómalos", buscando para ellos los casos atípicos basados sobre las desviaciones de casos similares y de las razones para tales desviaciones. 

Este recurso, se puede verificar tanto sobre variables originales o mediante la creación de nuevas variables (transformación de las existentes en la base de datos). Y una vez que hayan identificado los casos inusuales, se puede examinar más a fondo estos casos y determinar si se deben incluir en nuestros análisis. Para este caso hemos usado la base de datos correspondiente a las elecciones al parlamento español, celebradas en junio de 2016, con objeto de averiguar si existen patrones anómalos interesantes en el comportamiento del voto (Parsons, 1998; Tung, 2016).

viernes, 11 de marzo de 2016

Grado de significación (p). Revisión ASA

Desde hace tiempo, se ha venido señalando que los valores de p son, en el mejor de los casos, un estadístico con bajo valor informativo sobre la investigación realizada, y muchas veces engañoso. Y sobre todo a raíz de artículo de E.Vul (2009), este concepto del grado de significación (pruebas p), ha sido objeto de críticas generalizadas. Se han intentado corregir sus resultados más contradictorios, como podemos observar en distintas librerías implementadas por ejemplo en R (Herrero et al., 2011), e incluso eliminarlo (Newcombe, 2013), pero la gran aceptación que tiene en el campo de las publicaciones científicas ha resistido hasta ahora todos los intentos.

sábado, 9 de enero de 2016

La replicación de los estudios en Psicología:Uso del programa R

En el proceso de obtención del conocimiento científico, son importantes los mecanismos que replican los experimentos en el campo de la Psicología. El fundamento es que otros investigadores deben de poder ser capaces de repetir los resultados de los estudios publicados. 

Dentro de esta filosofía encontramos el proyecto de B.Nosek (Open Science Collaboration, 2015), destinado a facilitar la replicación de los resultados de 100 estudios publicados en revistas de Psicología, repitiéndose los estudios tal como se describen en los documentos seleccionados, y analizando los datos recogidos. Con el fin de maximizar la reproductibilidad y precisión, los análisis de todos los estudios duplicados fueron repetidos por otros analistas independientes del primer equipo de ejecución, usando para ello el lenguaje de programación R, con un formato estandarizado. 

domingo, 31 de mayo de 2015

Modelado geoespacial en SPSS 23

Los sistemas de información geográfica (SIG), compuestos de una base de datos espacialmente referenciada y de un conjunto de instrucciones (procedimientos) que nos ayudan a manejarla (Burrough y McDonnell, 1998), son un elemento básico en la construcción de modelos psicosociales operados a la luz de la Metodología Mixta. Este modelado geoespacial puede utilizar datos de mapas que contienen información respecto a las áreas geográficas y datos demográficos u otros elementos descriptivos como, por ejemplo, informes de población relativos a las tasas de desempleo.

El programa SPSS 23, en su módulo base, incorpora ahora un asistente de modelado geoespacial, bastante sencillo de utilizar. Está incorporado en las opciones de análisis:


miércoles, 25 de marzo de 2015

El estadístico Masa en Análisis de Correspondencias

El Análisis de Correspondencias(AC), es un procedimiento que permite describir de forma geométrica las relaciones entre variables de diversa naturaleza. Dentro de este procedimiento nos encontramos entre los primeros resultados el concepto estadístico de Masa, que simplemente es la frecuencia relativa de los totales filas y columnas en la tabla de datos analizada.
Se utiliza tanto para ponderar los perfiles de los puntos, como en la interpretación de la importancia de un punto (influencia) en el análisis desarrollado (los modelos deben seguir a los datos, y no al revés; Benzécri, 1976).  De esta forma, al considerar los puntos con una masa proporcional se evita privilegiar las categorías con frecuencias bajas o nulas.

sábado, 28 de febrero de 2015

Odds Ratio en R

En Metodología, frecuentemente usamos algoritmos para considerar una exposición (por ejemplo , absentismo escolar) y determinar su relación al comportamiento problemático (por ejemplo , la delincuencia juvenil) . Son útiles a la hora de expresar una cantidad (magnitud) del riesgo de comportamiento problemático para las personas que son expuestas a determinados agentes.

Supongamos un ejemplo con los datos siguientes: 
Tabla de Absentismo escolarxComportamientos-delictivos 
                        Delincuentes    No delincuentes 
Si-absentismo     2 (a)                8 (b) 
No-absentismo 10 (c)            990 (d) 

El riesgo se expresa en modelos de probabilidad, de una exposición dada causando un comportamiento. Es decir, la probabilidad de comportamiento problemático en los expuestos con respecto a la probabilidad de comportamiento problemático en los que no han sido expuestos. A esto, se conoce como el riesgo relativo (RR).
RR(delincuente en el grupo con absentismo/delincuente en el grupo no absentista)=(2/10)/(10/990)=19,8 

martes, 14 de octubre de 2014

Análisis de Datos Simbólicos: librería ISDA.R

Si se requiere usar una aproximación numérica a un problema matemático, y se exige precisión, los datos se suele asumir, que deben representarse por intervalos. Ya que cualquier dato incorpora un error en la entrada:
 Dato = modelo + error 
En el análisis clásico de datos, una variable en cada individuo, observación o unidad solo puede tomar un valor. Mientras que en el ADS [Análisis de Datos Simbólicos (Bock & Diday, 2000)] una variable puede ser un intervalo de números reales (valorada por intervalos). Son un caso particular de los datos simbólicos...
 X = [Xi,Xs] ={Xi <= X <= Xs}
Una librería en R, muy aconsejable para introducirse en este nuevo tipo de análisis, es ISDA.R

Referencias 
Bock,H.-H. & Diday,E. (eds.) (2000). Analysis of Symbolic Data. Berlin,Germany: Springer-Berlag.

miércoles, 25 de junio de 2014

Simulación en R: Matrices de correlaciones

Brevemente presentamos un procedimiento de simulación en R, que tiene como objetivo la generación de números pseudoaleatorios relacionados de acuerdo a un patrón fijado de antemano por el investigador. 
Posteriormente se presenta de forma gráfica la estructura alcanzada.
----
Procedimiento general de simulación:
library(psych)
library(MASS)
PatCorr <- matrix(c(1, 0.8, -0.4, 0.2,
                   0.8, 1,   0.15, 0.3,
                  -0.4, 0.15,   1, 0.1,  
                   0.2, 0.3, 0.1,   1),nrow=4)

M <- mvrnorm(5000, mu=rep(0,4), Sigma = PatCorr,empirical = TRUE)
---
Procedimiento de resultados:
head(M)  
pairs.panels(M)
---
Obteniéndose en este caso simulado...
            [,1]        [,2]       [,3]        [,4]
[1,]  0.04508237  0.13164350 -0.4929757  0.37310566
[2,]  1.07220292  0.67510691 -0.9520928 -1.01714666
[3,]  0.41117075  0.38988280 -0.6533527 -0.21138061
[4,] -0.05390150 -0.04880109  0.1695599 -0.05594154
[5,] -0.54652194  0.32840506  0.7111292 -0.18216643
[6,] -1.23544943 -1.51118618 -1.0223330  0.92505704
....

En caso de ajustar el valor de p para múltiples contrastes usaremos el procedimiento:
datos<-as.data.frame(M)

corr.test(datos, y = NULL, 
use = "pairwise",method="pearson",adjust="holm",alpha=.05)

lunes, 5 de mayo de 2014

Intermail (BITNET-EARN)

El desarrollo militar de la red INTERNET nos ha dejado documentos interesantes, a los cuales podemos acceder una vez desclasificados. Un ejemplo de lo comentado es este informe (formato pdf), sobre la estructura de lo que en su momento se conocía como Intermail:


jueves, 10 de abril de 2014

Fusion Tables en Google

Fusion Tables, es un servicio en la nube de Google, destinado a la gestión de datos. Estos, se almacenan en varias tablas que los usuarios de Internet pueden tanto ver y/o descargar (Halevy y Shapley,2009). Es una herramienta importante para la investigación y la representación de datos (Gonzalez et at., 2010; Gupta et al., 2013), sobre todo en aquellas disciplinas que usan técnicas SIG.


El servicio web proporciona un medio para visualizar los datos  gráficos clásicos, como son los circulares, los diagramas de barras o dispersión y líneas de tiempo; así como mapas geográficos basados en Google Maps. Estos, además de usar coordenadas (latitud,longitud), también pueden utilizar directamente la información de las direcciones postales (calle, número, localidad).  
Por otra parte, además de hacer mapas con posiciones de cada georeferencia, también puede realizarse "mapas de calor" (densidad de posiciones). 

Finalmente, señalaremos que los datos pueden ser exportados a otros formatos de archivo, posibilitando de esta forma su tratamiento por otro tipo de herramientas en Proceso de Datos.



Referencias
*Halevy,A. and Shapley,R.(2009). Google Fusion Tables. Google.
*Gonzalez,H.;  Halevy,A.;  Jensen,C.S.;  Langen,A.; Madhavan,J.; Shapley,R. y Shen,W. (2010). Google Fusion Tables: Data Management, Integration and Collaboration in the Cloud. SoCC'10. ACM.
*Gupta,N.; Halevy,A.Y.; Harb,B.; Lam,H.; Lee,H.; Madhavan,J.; Wu,F. y Yu,C. (2013). Recent progress towards an ecosystem of structured data on the Web. IEEE 29th International Conference on Data Engineering (ICDE), Actas pp. 5-8.

miércoles, 12 de febrero de 2014

Otra investigación sobre p

La controversia sobre el uso del grado de significación no cede, y no es raro encontrar  trabajos que refutan su uso en el campo científico. En esta línea, el último artículo que encontramos es el correspondiente a Regina Nuzzo, titulado "Scientific method: Statistical errors. P values, the 'gold standard' of statistical validity, are not as reliable as many scientists assume."
(Nature 506, 150–152 13 February 2014) doi:10.1038/506150a
URL: http://www.nature.com/news/scientific-method-statistical-errors-1.14700?WT.mc_id=FBK_NPG_1402_NatureNews

martes, 10 de diciembre de 2013

PISA 2012


PISA es el nombre que recibe una evaluación de conocimientos y destrezas de alumnos de 15 años, en las áreas de Matemáticas, Lectura y Ciencias. Los países implicados pueden variar de un periodo a otro ya que es voluntario.
Los datos brutos así como los procedimientos de cálculo automático, correspondientes al año 2012, pueden ser consultados en el siguiente enlace:
Database - PISA 2012

miércoles, 16 de octubre de 2013

SPSS (CrowdSourcing)

El trabajo en la red, de forma cooperativa, es algo bien conocido en estos tiempos. Desde hace años, el SPSS incorpora un elemento que encaja dentro de esta filosofía. Concretamente la posibilidad de acceder a bases de datos que no están almacenadas en nuestras máquinas, sino en lo que se conoce como la nube. Posibilitando de esta forma el acceso a distintos investigadores sin tener la necesidad de almacenarlos en sus dispositivos.
La instrucción implementada en concreto:
SPSSINC GETURI DATA
En el ejemplo mostrado en la imagen siguiente podemos ver la pantalla de acceso a una base de datos:
Encaja en la filosofía de hacer público los datos (poner en línea los datos), como una forma de que otros sean capaces de avanzar rápidamente en la línea de investigación. Si hay algunas restricciones de confidencialidad, se deben retirar los elementos que puedan ayudar a la identificación de los encuestados.

martes, 15 de octubre de 2013

Python & SPSS

Python es un lenguaje integrado dentro del programa IBM SPSS. De naturaleza intérprete, multiparadigmático (soporta orientación a objetos, programación imperativa y funcional).

Es útil, junto al R, a la hora de utilizar  tareas repetitivas, o bien en operaciones avanzadas no disponibles a través de los cuadros de diálogo. Es un complemento básico si usamos la sintaxis de IBM SPSS, permitiendo el acceso a estructuras complejas de programación.

En SPSS se programa de forma general en el editor de sintaxis, permitiendo su cifrado. Se puede proteger con una contraseña. Estos archivos solo se pueden abrir proporcionando la contraseña (extensión spsx).

lunes, 7 de octubre de 2013

IBM SPSS 22.0

El IBM SPSS Web Report es un informe interactivo que se puede abrir en un navegador y contiene diagramas, tablas y otros resultados producidos por IBM SPSS Statistics. Puesto que este documento es un solo archivo, se puede colocar en cualquier sitio web sin necesidad de servidores o configuración adicionales, se puede publicar en un servidor de archivos compartidos, se puede copiar en un medio de archivo portátil o se puede distribuir a través del correo electrónico. 
Los informes web son archivos HTML5 que se pueden abrir en todas las versiones posteriores de los navegadores utilizados con más frecuencia.