domingo, 17 de marzo de 2019

Reflexiones sobre el BigData

ANALÍTICA DEL APRENDIZAJE CONECTADO

Six Provocations for Big Data
danah boyd (Microsoft Research) y Kate Crawford (University of New South Wales)

‘The era of Big Data has begun’, así comienzan las autoras su artículo sobre el Big Data, preguntándose, a su vez, si esta era traerá consigo el desarrollo de curas o soluciones para problemas globales o si, por el contrario, contribuirá a aumentar las desigualdades sociales o profesionales.
Big Data, argumentan, es quizá no el mejor término para describir este fenómeno pues lo más característico de estos datos no es su tamaño sino su capacidad de formar relaciones con otros datos, la inmensa capacidad de relación dentro de la red entre datos, individuos, grupos, funciones, etc. que acaban creando un ecosistema dentro del que todo se mueve.
Sin embargo, esta interconexión puede llevar a la apophenia, a una euforia que parece hacer creer que hay conexiones entre datos que realmente no están relacionados simplemente porque la gran cantidad de información proporcionada por el Big Data proyecta datos en tantas direcciones distintas que las verdaderas conexiones se pierden.
El Big Data se analiza, se estudia, todos producimos datos en cada una de nuestras intervenciones digitales, dejamos una huella digital que va almacenándose y que es susceptible de ser analizada y utilizada. Los datos conforman todo un universo en el que nos movemos a diario y que vamos creando con ese mismo movimiento a través de él. Por ello resulta de vital importancia saber cómo enfrentarse, manejar y moverse por esta era del Big Data. Ya que el análisis de estos datos está cada vez más automatizado, creando algoritmos que serán finalmente el elemento que redistribuye esta información en los usuarios-productores de datos.
Enlace al programa de radio Hoy Empieza Todo de Radio 3 sobre ‘Ruido en la red’

 Las autoras proponen aquí seis “provocaciones”, seis enunciados para incitar a pensar y cuestionarse el lugar y la importancia del Big Data.

1. Automating Research Changes the Definition of Knowledge.
La automatización hizo que el siglo XX se construyese alrededor del fordismo, la producción en cadena trajo consigo beneficios materiales que cambiaron la forma de contemplar el trabajo, ya no más como un proceso lento y artesanal, sino como el proceso rápido, repetido que permitía producir más y más para consumir más y más. ¿Ha cambiado, el Big Data, el conocimiento y la forma de acceder a él y presentarlo, igual que lo hizo Ford con la fabricación de coches?
El Big Data no solo se refiere a ingente cantidad de datos sino a la forma de considerar y abordar esos datos y cómo afectan al sistema de conocimiento al cambiar los propios objetos de conocimiento, apuntan las autoras, la forma de investigar cambia radicalmente al tener los investigadores a su alcance semejante cantidad de conocimiento. A propósito de esto, se cita a Chris Anderson, Editor de Wired, quien considera que no importa por qué la gente se comunica, sino que lo hace y medirlo es lo que importa ya que las cifras hablan por sí solas. Pero ¿es eso así? ¿Son las cantidades, las medidas, los números lo que realmente producen conocimiento?
Enlace a Wired, ‘The Petabyte Age’:

Las autoras responden a esto con un claro ‘no’, un no a la macro-importancia dada por algunos sectores a las cifras ofrecidas por el Big Data, dejando de lado otros tipos de mecanismos de investigación y las motivaciones detrás de toda la producción de esos datos, la filosofía que debería estar en la base de las interacciones humanas. El Big Data pierde la visión global, los porqués y los motivos humanos que provocan la producción de los datos analizados.
La automatización de los mecanismos de investigación puede traer consigo el cambio del significado del conocimiento, cómo accedemos al conocimiento, qué clase conocimiento es ese y qué valor tiene. 
Post sobre la automatización del trabajo intelectual:
2. Claims to Objectivity and Accuracy are Misleading
El Big Data ofrece el respaldo cuantitativo para aquellas investigaciones de humanidades que buscan ser consideradas ciencias objetivas, frente a la subjetividad que subyace a las investigaciones cualitativas. Sin embargo, el Big Data sigue siendo subjetivo, especialmente por la falta de veracidad en aquello relacionado con los datos obtenidos en las redes sociales. Tradicionalmente, en el método científico, lo subjetivo ha estado bajo sospecha, alejándose de la producción y exposición de hechos, sin embargo, cualquier examen o investigación está basada en elecciones y observaciones hechas por sujetos, por personas, subjetivas, entonces. Cualquier investigador o científico tiene que interpretar los datos y esta interpretación conlleva una subjetividad intrínseca al ser humano.
Añaden, aquí, las autoras los errores en los datos obtenidos en Internet, con fuentes poco precisas o fiables, datos incompletos y otros errores que se magnifican al relacionarse con otros datos. Sumado a todo ello está los sesgos personales de los investigadores que dependen de su origen, identidad y perspectiva hacia los datos o los análisis.
Por lo tanto, la subjetividad implícita en los análisis de los datos sociales ha de ser tenida en cuenta para que el uso del Big Data sea realmente efectivo.
Post sobre objetividad vs subjetividad.


3. Bigger Data are Not Always Better Data
Más no significa mejor. Cantidad y calidad no aumentan de forma directamente proporcional, a pesar de que algunos de los partidarios del Big Data defiendan esta premisa. El análisis de datos de una determinada red social, Twitter, puede ofrecer ejemplos de datos que, aunque muy numerosos y accesibles no pueden ser evaluados equivalentemente. Dentro de toda la objetividad que puede representar una determinada cifra de datos, está la variabilidad de la producción de esos datos.
Junto con esto, se encuentra el hecho de que ingentes cantidades de datos no es lo mismo que todos los datos, sumado a que la muestra tomada puede estar ya segada por diferentes razones como cuentas privadas que no son accesibles a los investigadores o tweets que hayan sido retirados por Twitter por contenido considerado inapropiado. Los errores y la imprecisión se multiplican, entonces, al combinar el estudio de varios conjuntos de datos (datasets) o al combinar distintas fuentes.
Las autoras terminan este punto rompiendo una lanza a favor de ‘small data’: ‘in some cases, small is best.
Sobre ‘lurkers’ en Twitter

















4. Not All Data Are Equivalent
El contexto marca el significado de los datos y su valor. Aquí, las autoras se fijan en las redes sociales, no solo las digitales, sino las relaciones humanas hechas en sociedad, y en el interés que estas redes y el ‘social graph’ o grafo social provoca en los analistas. Éstos buscan entender las relaciones humanas y sociales utilizando variados enfoques analíticos, como el rastreo de datos.
Sin embargo, los rastros dejados por un determinado individuo con su actividad digital y la proximidad de los rastros de otro individuo conectados con los anteriores no implican que ambos individuos tengan una relación o, ni siquiera, sepan el uno del otro. Las relaciones sociales son mucho más complejas que los rastros dejados en determinadas redes sociales, por ejemplo.
Partiendo de los primeros estudios hechos por sociólogos y antropólogos que recababan datos por medio de entrevistas, encuestas, o experimentos, para describir redes personales, el Big Data incorpora dos nuevos tipos de relaciones sociales: ‘redes articuladas’ y ‘redes de comportamiento’. En las primeras los individuos especifican sus contactos a través de medios tecnológicos, como ‘amigos’ o seguidores, mientras que en las segundas hay un contacto en forma de mensajes de texto, o son personas que físicamente comparten un espacio y son etiquetadas en una foto, por ejemplo.
Los análisis del Big Data reflejan que, si dos individuos comparten frecuentemente algunos de los espacios digitales online, están relacionados de alguna manera, pero no tiene en cuenta que frecuencia no es lo mismo a fuerza o cercanía, no sabe de relaciones personales.
Redes sociales: un antes y un después en el comportamiento humano


5. Just Because it is Accessible Doesn’t Make it Ethical
Todos los datos publicados en redes sociales son públicos, ¿significa eso que pueden utilizarse por terceros libremente? No. De hecho, existen leyes que así lo certifican. Desde hace varias décadas, los investigadores y las autoridades han implementado marcos para evaluar la ética de distintos procedimientos de investigación que implican seres humanos. La privacidad es uno de los derechos que se intentan resguardar con estas leyes para que la información personal publicada por los individuos sólo pueda ser utilizada con el consentimiento de la persona implicada, ya que hay ‘a considerable difference between being in public and being public’. 
Ley de protección de datos:


6. Limited Access to Big Data Creates New Digital Divides
Tradicionalmente, la recogida de datos para su estudio ha sido un trabajo laborioso, intenso y largo, por lo que la llegada del Big Data ha provocado un entusiasmo desmedido creyendo que ofrece un acceso fácil a ingentes cantidades de datos. ¿Es esto así? No.
No todos los investigadores tienen acceso a todos los datos disponibles, hay datos por los que hay que pagar, otros tienen el acceso restringido a un determinado tipo de investigadores o a personal dentro de la propia compañía, por lo que muchos investigadores quedan sin acceso a un gran número de datos.
Los medios económicos, la pertenencia a un centro educativo de prestigio o las habilidades computacionales de los investigadores que pueden ser desarrolladas y reforzadas más eficientemente en universidades de prestigio conforman las desigualdades a la hora de acceder a los datos.
Esto crea una división que las autoras nombran, ‘Big Data rich’ y ‘Big Data poor’ a lo que se añaden las tres clases de habitantes del reino del Big Data, según Manovich: quienes crean los datos, los que tienen los medios para recopilarlos y quienes tienen la capacidad para interpretarlos.
En este enlace se puede escuchar la entrevista con el analista digital Morozov.

  
Referencias:

Big Data, privatización y desigualdad. Una entrevista con Evgeny Morozov

Big Data, ¿solo datos? ¿Objetividad vs Subjetividad?

boyd, d. and Crawford, K. (2011) ‘Six Provocations for Big Data’

Como lograr que el ‘Big Data’ no genere injusticia

Ley de protección de datos:

¿Qué son la objetividad y la subjetividad?

Redes sociales: un antes y un después en el comportamiento humano

‘Ruido en la red’ en Hoy Empieza Todo de Radio 3

Seis contradicciones y el fin del presente. Evgeny Morozov. El capitalismo digital y sus descontentos

Twitter’s 500 Million Lurkers: A Mixed Blessing?

What Will the Automation of Knowledge Work Really Mean For You?

Will machine learning replace human know-how?

Will the future of knowledge work automation transform personalized medicine?

Wired, ‘The Petabyte Age’:


No hay comentarios:

Publicar un comentario