ANALÍTICA DEL APRENDIZAJE CONECTADO
Six Provocations for Big Data
danah boyd (Microsoft Research) y Kate Crawford (University of New South
Wales)
‘The era of Big Data
has begun’, así comienzan las autoras su artículo sobre el Big Data,
preguntándose, a su vez, si esta era traerá consigo el desarrollo de curas o
soluciones para problemas globales o si, por el contrario, contribuirá a
aumentar las desigualdades sociales o profesionales.
Big Data, argumentan,
es quizá no el mejor término para describir este fenómeno pues lo más
característico de estos datos no es su tamaño sino su capacidad de formar
relaciones con otros datos, la inmensa capacidad de relación dentro de la red
entre datos, individuos, grupos, funciones, etc. que acaban creando un
ecosistema dentro del que todo se mueve.
Sin embargo, esta
interconexión puede llevar a la apophenia,
a una euforia que parece hacer creer que hay conexiones entre datos que
realmente no están relacionados simplemente porque la gran cantidad de
información proporcionada por el Big Data proyecta datos en tantas direcciones
distintas que las verdaderas conexiones se pierden.
El Big Data se
analiza, se estudia, todos producimos datos en cada una de nuestras
intervenciones digitales, dejamos una huella digital que va almacenándose y que
es susceptible de ser analizada y utilizada. Los datos conforman todo un
universo en el que nos movemos a diario y que vamos creando con ese mismo
movimiento a través de él. Por ello resulta de vital importancia saber cómo
enfrentarse, manejar y moverse por esta era del Big Data. Ya que el análisis de
estos datos está cada vez más automatizado, creando algoritmos que serán
finalmente el elemento que redistribuye esta información en los
usuarios-productores de datos.
Enlace al programa de radio Hoy Empieza Todo de Radio 3 sobre ‘Ruido en la red’
Las autoras proponen
aquí seis “provocaciones”, seis enunciados para incitar a pensar y cuestionarse
el lugar y la importancia del Big Data.
1. Automating Research
Changes the Definition of Knowledge.
La automatización
hizo que el siglo XX se construyese alrededor del fordismo, la producción en
cadena trajo consigo beneficios materiales que cambiaron la forma de contemplar
el trabajo, ya no más como un proceso lento y artesanal, sino como el proceso
rápido, repetido que permitía producir más y más para consumir más y más. ¿Ha
cambiado, el Big Data, el conocimiento y la forma de acceder a él y presentarlo,
igual que lo hizo Ford con la fabricación de coches?
El Big Data no solo
se refiere a ingente cantidad de datos sino a la forma de considerar y abordar
esos datos y cómo afectan al sistema de conocimiento al cambiar los propios
objetos de conocimiento, apuntan las autoras, la forma de investigar cambia
radicalmente al tener los investigadores a su alcance semejante cantidad de
conocimiento. A propósito de esto, se cita a Chris Anderson, Editor de Wired,
quien considera que no importa por qué la gente se comunica, sino que lo hace y
medirlo es lo que importa ya que las cifras hablan por sí solas. Pero ¿es eso
así? ¿Son las cantidades, las medidas, los números lo que realmente producen
conocimiento?
Enlace a Wired, ‘The Petabyte
Age’:
Las autoras responden
a esto con un claro ‘no’, un no a la macro-importancia dada por algunos
sectores a las cifras ofrecidas por el Big Data, dejando de lado otros tipos de
mecanismos de investigación y las motivaciones detrás de toda la producción de
esos datos, la filosofía que debería estar en la base de las interacciones humanas.
El Big Data pierde la visión global, los porqués y los motivos humanos que
provocan la producción de los datos analizados.
La automatización de
los mecanismos de investigación puede traer consigo el cambio del significado
del conocimiento, cómo accedemos al conocimiento, qué clase conocimiento es ese
y qué valor tiene.
Post sobre la automatización del trabajo intelectual:
2. Claims to Objectivity
and Accuracy are Misleading
El Big Data ofrece el
respaldo cuantitativo para aquellas investigaciones de humanidades que buscan
ser consideradas ciencias objetivas, frente a la subjetividad que subyace a las
investigaciones cualitativas. Sin embargo, el Big Data sigue siendo subjetivo,
especialmente por la falta de veracidad en aquello relacionado con los datos
obtenidos en las redes sociales. Tradicionalmente, en el método científico, lo
subjetivo ha estado bajo sospecha, alejándose de la producción y exposición de
hechos, sin embargo, cualquier examen o investigación está basada en elecciones
y observaciones hechas por sujetos, por personas, subjetivas, entonces.
Cualquier investigador o científico tiene que interpretar los datos y esta
interpretación conlleva una subjetividad intrínseca al ser humano.
Añaden, aquí, las
autoras los errores en los datos obtenidos en Internet, con fuentes poco
precisas o fiables, datos incompletos y otros errores que se magnifican al
relacionarse con otros datos. Sumado a todo ello está los sesgos personales de
los investigadores que dependen de su origen, identidad y perspectiva hacia los
datos o los análisis.
Por lo tanto, la
subjetividad implícita en los análisis de los datos sociales ha de ser tenida
en cuenta para que el uso del Big Data sea realmente efectivo.
Post sobre objetividad vs subjetividad.
3. Bigger Data are Not Always Better Data
Más no significa mejor.
Cantidad y calidad no aumentan de forma directamente proporcional, a pesar de
que algunos de los partidarios del Big Data defiendan esta premisa. El análisis
de datos de una determinada red social, Twitter, puede ofrecer ejemplos de
datos que, aunque muy numerosos y accesibles no pueden ser evaluados
equivalentemente. Dentro de toda la objetividad que puede representar una
determinada cifra de datos, está la variabilidad de la producción de esos
datos.
Junto con esto, se encuentra
el hecho de que ingentes cantidades de datos no es lo mismo que todos los
datos, sumado a que la muestra tomada puede estar ya segada por diferentes
razones como cuentas privadas que no son accesibles a los investigadores o
tweets que hayan sido retirados por Twitter por contenido considerado
inapropiado. Los errores y la imprecisión se multiplican, entonces, al combinar
el estudio de varios conjuntos de datos (datasets) o al combinar distintas
fuentes.
Las autoras terminan este
punto rompiendo una lanza a favor de ‘small data’: ‘in some cases, small is
best.
Sobre ‘lurkers’ en Twitter
4. Not All Data
Are Equivalent
El contexto marca el
significado de los datos y su valor. Aquí, las autoras se fijan en las redes
sociales, no solo las digitales, sino las relaciones humanas hechas en
sociedad, y en el interés que estas redes y el ‘social graph’ o grafo social
provoca en los analistas. Éstos buscan entender las relaciones humanas y
sociales utilizando variados enfoques analíticos, como el rastreo de datos.
Sin embargo, los rastros
dejados por un determinado individuo con su actividad digital y la proximidad
de los rastros de otro individuo conectados con los anteriores no implican que
ambos individuos tengan una relación o, ni siquiera, sepan el uno del otro. Las
relaciones sociales son mucho más complejas que los rastros dejados en determinadas
redes sociales, por ejemplo.
Partiendo de los primeros
estudios hechos por sociólogos y antropólogos que recababan datos por medio de
entrevistas, encuestas, o experimentos, para describir redes personales, el Big
Data incorpora dos nuevos tipos de relaciones sociales: ‘redes articuladas’ y
‘redes de comportamiento’. En las primeras los individuos especifican sus
contactos a través de medios tecnológicos, como ‘amigos’ o seguidores, mientras
que en las segundas hay un contacto en forma de mensajes de texto, o son
personas que físicamente comparten un espacio y son etiquetadas en una foto,
por ejemplo.
Los análisis del Big Data
reflejan que, si dos individuos comparten frecuentemente algunos de los
espacios digitales online, están relacionados de alguna manera, pero no tiene
en cuenta que frecuencia no es lo mismo a fuerza o cercanía, no sabe de
relaciones personales.
Redes sociales: un antes y un después en el comportamiento humano
5. Just Because it is
Accessible Doesn’t Make it Ethical
Todos los datos
publicados en redes sociales son públicos, ¿significa eso que pueden utilizarse
por terceros libremente? No. De hecho, existen leyes que así lo certifican.
Desde hace varias décadas, los investigadores y las autoridades han
implementado marcos para evaluar la ética de distintos procedimientos de
investigación que implican seres humanos. La privacidad es uno de los derechos
que se intentan resguardar con estas leyes para que la información personal
publicada por los individuos sólo pueda ser utilizada con el consentimiento de
la persona implicada, ya que hay ‘a considerable difference between being in
public and being public’.
Ley de protección de
datos:
6. Limited Access to Big
Data Creates New Digital Divides
Tradicionalmente, la
recogida de datos para su estudio ha sido un trabajo laborioso, intenso y
largo, por lo que la llegada del Big Data ha provocado un entusiasmo desmedido
creyendo que ofrece un acceso fácil a ingentes cantidades de datos. ¿Es esto
así? No.
No todos los
investigadores tienen acceso a todos los datos disponibles, hay datos por los
que hay que pagar, otros tienen el acceso restringido a un determinado tipo de
investigadores o a personal dentro de la propia compañía, por lo que muchos
investigadores quedan sin acceso a un gran número de datos.
Los medios económicos, la pertenencia a un centro educativo de prestigio o
las habilidades computacionales de los investigadores que pueden ser
desarrolladas y reforzadas más eficientemente en universidades de prestigio
conforman las desigualdades a la hora de acceder a los datos.
Esto crea una división que las autoras nombran, ‘Big Data rich’ y ‘Big Data
poor’ a lo que se añaden las tres clases de habitantes del reino del Big Data,
según Manovich: quienes crean los datos, los que tienen los medios para
recopilarlos y quienes tienen la capacidad para interpretarlos.
En este enlace se puede escuchar la entrevista
con el analista digital Morozov.
Referencias:
Big Data,
privatización y desigualdad. Una entrevista con Evgeny Morozov
Big Data, ¿solo datos? ¿Objetividad vs Subjetividad?
boyd, d. and Crawford, K. (2011) ‘Six Provocations for
Big Data’
Como lograr que el ‘Big Data’ no genere injusticia
Ley de protección de datos:
¿Qué son la objetividad y la subjetividad?
Redes sociales: un antes y
un después en el comportamiento humano
‘Ruido en la red’ en Hoy Empieza Todo de Radio 3
Seis contradicciones y
el fin del presente. Evgeny Morozov. El capitalismo digital y sus descontentos
Twitter’s 500 Million
Lurkers: A Mixed Blessing?
What Will the Automation of
Knowledge Work Really Mean For You?
Will machine learning replace human know-how?
Will the future of knowledge work automation
transform personalized medicine?
Wired, ‘The Petabyte Age’: