Os 7 projetos mais comuns com Hadoop

Os 7 projetos mais comuns com Hadoop 1
Crédito:
flickr / Robert Scoble
De acordo com a Infoworld, a maioria dos projetos Hadoop se encaixa perfeitamente em um desses sete tipos.
O artigo cita um provérbio que diz: se você oferecer a alguém o seu total apoio
e respaldo financeiro para fazer algo diferente e inovador, vai
acabar fazendo o que todo mundo está fazendo.

Todo
mundo pensa que está fazendo algo especial com estas novas
tecnologias de Big Data, mas não demora muito para encontrar os
mesmos padrões. Alguns casos específicos podem diferir um pouco,
mas aqui estão os sete projetos mais
comuns.

Projeto
1: Consolidação de Dados

Chamado de “Enterprise Data Hub” ou “Data Lake“, a principal ideia é que você tem diferentes fontes de dados e que
pretende realizar a análise através deles.
Este tipo de projeto
consiste em obter dados de todas as fontes (em tempo real ou em lote)
e carregá-los no Hadoop.
Às vezes, é o primeiro passo para se
tornar uma “empresa controlada por dados”; Às vezes você
simplesmente quer relatórios bonitos.
Os dados provenientes do “Data Lake” geralmente são armazenados como arquivos no HDFS e em
tabelas no Hive ou Impala. O futuro é armazenar e gerenciar os dados
no HBase e Phoenix, uma vez que o Hive é mais lento.
Os
vendedores gostam de dizer coisas como “esquema de leitura”,
mas na verdade, para ter sucesso, você deve ter em mente quais serão
seus casos de uso (o Hive não é tão diferente de um Data Warehouse).
A verdadeira razão para um “Data Lake” é a
escalabilidade horizontal e custo muito mais baixo do que Teradata ou
Netezza.
Para a “análise”, muitas pessoas configuram o
Tableau e o Excel no front-end. Empresas mais sofisticadas com
“cientistas de dados reais” usam Zeppelin ou iPython Notebook como front-end.

Projeto
2: Análise Especializada

Muitos
projetos de consolidação de dados efetivamente começam aqui, onde
você tem uma necessidade especial de carregar um conjunto de dados
para um sistema que faz algum tipo de análise.
Estes tendem a ser de
domínios específicos, tais como risco de liquidez/simulações de
Monte Carlo em um banco.
No passado, tais análises especializadas
dependiam de pacotes proprietários, antiquados, que não poderiam se
igualar como os dados faziam e frequentemente sofriam de um conjunto
limitado de funcionalidades (em parte porque o fornecedor do software
não poderia saber tanto sobre o domínio como a instituição imersa
nele).
Nos
mundos Hadoop e Spark, estes sistemas verificam praticamente o mesmo
que os sistemas de consolidação de dados, mas muitas vezes têm
mais HBase, código NoSQL customizado e menos fontes de dados (talvez apenas uma). Cada vez mais, eles são baseados no Spark.

Projeto
3: Hadoop como um Serviço

Comum em grandes organizações com projetos de “análises
especializadas” (e, ironicamente, um ou dois projetos de
“consolidação de dados”) que, inevitavelmente, vai
começar a sentir a “alegria” (isto é, dor) de gerenciar
alguns clusters Hadoop diferentemente configurados, muitas vezes, de
diferentes fornecedores.
Em seguida, vão dizer: “Talvez
devêssemos consolidar essa situação e reunir recursos”, ao
invés de ter a metade de seus nós ociosos pela metade do tempo.
Eles poderiam ir para a nuvem, mas muitas empresas não podem ou não
querem, muitas vezes para a sua própria segurança (leia-se: a
política interna da organização).
Isso geralmente significa um
monte de receitas prontas e posteriormente contêineres de pacotes
Docker.
Blue Data parece ser o mais próximo de uma
solução “fora da caixa”, que também vai apelar para
organizações menores que carecem de recursos para implantar o
Hadoop como um serviço.

Projeto
4: Análise de Streaming

Muitas
pessoas chamam isso de “streaming“, mas análise de streaming é bastante diferente do streaming tradicional a que estamos
acostumados.
Muitas vezes, análise de streaming é uma versão mais
em tempo real do que em lotes. Detecção de fraudes ou lavagem de
dinheiro: por que não fazer isso na base da transação e pegá-la
enquanto está processando, em vez de no final de um ciclo? O mesmo
vale para a gestão de inventário ou qualquer outra coisa.
Em
alguns casos, este é um novo tipo de sistema transacional que
analisa dados bit a bit como em um sistema de análise em paralelo.
Esses sistemas se manifestam como Spark ou Storm com HBase
(armazenamento de dados mais usual).
Note que a análise de streaming
não substitui todas as formas de análise; você ainda vai querer
procurar tendências históricas ou verificar dados do passado para
considerar algo que antes não tinha importância.

Projeto
5: Processamento de Eventos Complexos

Aqui
estamos falando de processamento de eventos em tempo real, onde
milissegundos importam.
Embora determinadas aplicações tenham tempos menores, tais como sistemas de negociação de
alta qualidade de ultra baixa latência (pico segundos ou nano
segundos), você pode esperar tempos de resposta em milissegundos.
Os
exemplos incluem a classificação em tempo real de registros de
dados de chamadas para empresas de telecomunicações ou processamento de eventos da Internet das coisas. 
Normalmente você verá que
esses sistemas usam o Spark e HBase, mas em geral eles são
convertidos para o Storm.
No
passado, esses sistemas foram baseados em software de mensagens
customizados – ou de alto desempenho, de prateleira, produtos de
mensagens cliente-servidor – mas os volumes de dados de hoje são
maiores para qualquer um.
Os volumes negociados e o número de
pessoas com celulares dispararam desde que esses sistemas legados
foram criados, além do que sensores médicos e industriais drenam
muitos bits.
O projeto Apex parece promissor
e mais rápido do que o Storm.

Projeto
6: Streaming como ETL

Às
vezes você quer capturar dados de streaming e armazená-los em algum
lugar. Esses projetos geralmente coincidem com o número 1 ou número
2, citados acima, mas com seu próprio escopo e características.
(Algumas pessoas pensam que estão fazendo os projetos 4 ou 5 mas, na
verdade, elas estão armazenando em disco para analisar mais tarde).
Estes são quase sempre projetos que envolvem Kafka e Storm. O Spark também é
usado, mas sem justificativa, a menos que você precise fazer
análise em memória.

Projeto
7: Substituir ou Aumentar SAS

SAS
é bom, mas também é caro e nós não estamos comprando caixas para
todos os cientistas e analistas de dados brincarem com os dados.
Além
disso, você quer fazer algo diferente do que a SAS pode fazer ou
gerar um gráfico mais bonito. Aqui está o seu belo “Data Lake”.
Aqui está o iPython Notebook ou Zeppelin. Vamos
preencher os resultados em SAS e armazenar resultados do SAS aqui.
Há projetos usando Hadoop, Spark ou Storm também. Se você estiver usando o Hadoop, você provavelmente
irá reconhecê-los.

Se
você é um veterano com muito medo do “Big” em Big Data
ou do Hadoop, não se preocupe. Quanto mais as
coisas mudam, mais elas permanecem iguais. Você vai encontrar muitas
semelhanças entre o material usado para implantar e as tecnologias
modernas que giram em torno da Hadooposfera.

Conclusão

Com este panorama dos tipos de projetos Hadoop mais comuns, pretendo ajudá-lo a identificar se sua empresa tem um caso de uso para as tecnologias para Big Data.
É comum que as pessoas pensem que têm projetos Big Data quando na verdade não têm, mas a “necessidade” de usar algo que todo mundo está comentando fala mais alto.
O entendimento dos casos de uso para Big Data pode poupar tempo e dinheiro, por isso fique atento!

Para saber mais

  1. Baixe o ebook sobre soluções para Big Data que escrevi;
  2. Se inscreva na lista que criei para discutir o tema no Google Groups;
  3. Confira minha palestra virtual apresentando os conceitos básicos da tecnologia, depois venha trocar idéias!

10 termos do Aprendizado de Máquina (Machine Learning) que você deve aprender o quanto antes!

Machine Learning - Penso, logo sou perigoso
Se você é novo no contexto do Aprendizado de Máquina e suas
aplicações (como eu), então já se deparou com alguns
termos muito técnicos que são muitas vezes difíceis para os iniciantes entenderem.
Por isso, resolvi traduzir os 10 termos de
Aprendizagem de Máquina relacionados pelo KDNuggets, num esforço louvável de torná-los mais fáceis de entender.
Vamos a eles.

Aprendizado de
Máquina (Machine Learning)

É um subcampo da
ciência da computação e inteligência artificial (IA) que incide
sobre a concepção de sistemas que podem aprender e tomar decisões
e previsões baseadas em dados.
O aprendizado de máquina permite que
os computadores possam agir e tomar decisões baseadas em dados ao
invés de serem explicitamente programados para realizar uma
determinada tarefa. 
Programas de aprendizagem de máquina também são
projetados para aprender e melhorar ao longo do tempo quando expostos
a novos dados.
O aprendizado de máquina tem estado no centro de
muitos avanços tecnológicos nos últimos anos, como carros
autônomos, visão computacional e sistemas de reconhecimento de voz.

Aprendizagem
Supervisionada

Sempre que o
programa é “treinado” em um conjunto de dados
pré-definido.
A partir desse treinamento, o programa
pode tomar decisões precisas quando recebe novos dados. 
Exemplo:
usando um conjunto de treinamento de recursos humanos com etiquetas
de tweets positivos, negativos e neutros para treinar um
classificador de análise de sentimento.

Aprendizagem não
Supervisionada

Quando um programa,
dado um conjunto de dados, pode automaticamente encontrar padrões e
relações de conjunto.
Exemplo: analisando um conjunto de dados de
e-mails e agrupar automaticamente os e-mails relacionados ao tema,
com nenhum conhecimento prévio ou de formação que também é
conhecido como a prática de agrupamento.

Classificação

Uma subcategoria do
aprendizado supervisionado, a Classificação é o processo de tomar
algum tipo de entrada e atribuir um rótulo a ela.
Sistemas de
classificação são usados ​​geralmente quando as previsões são
discretas: ou “sim” ou “não”.
Exemplo: mapeamento de uma
imagem de uma pessoa a uma classificação de gênero masculino ou
feminino.

Regressão

Outra subcategoria
do aprendizado supervisionado usado quando o valor que está sendo
previsto difere de um “sim” ou “não” à medida que se
encaixa em um espectro contínuo.
Sistemas de regressão poderiam ser
usados, por exemplo, para responder às perguntas de “Quanto?”
ou “Quantos?”.

Árvores de Decisão

Uma árvore de
decisão é uma ferramenta de apoio à decisão que usa um gráfico
de árvore ou modelo de decisões e suas possíveis consequências.
Uma árvore de decisão é também uma maneira de representar
visualmente um algoritmo.
Exemplo:
10 termos do Aprendizado de Máquina (Machine Learning) que você deve aprender o quanto antes! 2
A árvore de
decisão acima mostra a sobrevivência de passageiros do Titanic (“sibsp”
é o número de cônjuges ou irmãos a bordo).
Fonte:
http://en.wikipedia.org/wiki/Decision_tree_learning

Modelo Generativo

Em probabilidade e
estatística, um modelo generativo é um modelo usado para gerar
valores de dados quando alguns parâmetros estão ocultos.
Modelos
generativos são usados ​​em Aprendizado de Máquina para
qualquer modelagem de dados diretamente ou como um passo
intermediário para a formação de uma função densidade de
probabilidade condicional.
Em outros termos, um modelo P (x, y), a
fim de fazer previsões (que podem ser convertidas para p (x | y)
aplicando a regra de Bayes), bem como para ser capaz de gerar
prováveis pares ​​(x, y), que é amplamente utilizado na
Aprendizagem não supervisionada.
Exemplos de Modelos Generativos incluem Naive Bayes, Latent Dirichlet Allocation e Gaussian Mixture
Model.

Modelo Discriminativo

Modelos
discriminativos ou modelos condicionais são uma classe de modelos
usados ​​em Aprendizado de Máquina para modelar a dependência
de uma variável Y em uma variável X.
Como esses modelos tentam
calcular probabilidades condicionais, isto é, p (y | x), eles são
frequentemente utilizados em aprendizado supervisionado.
Exemplos
incluem Regressão Logística, SVMs e Redes Neurais.

Aprendizagem
Profunda (Deep Learning)

Tema quente nos
últimos anos, a aprendizagem profunda refere-se a uma categoria de
algoritmos de aprendizado de máquina que muitas vezes usam redes
neurais artificiais para gerar modelos.
Técnicas de aprendizado
profundo, por exemplo, foram muito bem sucedidos na resolução de
problemas de reconhecimento de imagem devido à sua capacidade de
escolher as melhores características, bem como para expressar
camadas de representação.

Redes Neurais ou
Redes Neurais Artificiais

10 termos do Aprendizado de Máquina (Machine Learning) que você deve aprender o quanto antes! 3
Uma rede neural
simples.
Fonte:
http://en.wikipedia.org/wiki/Artificial_neural_network

Inspirado por redes
neurais biológicas, redes neurais artificiais são uma rede de nós
interconectados que compõem um modelo.
Elas podem ser definidas como
modelos de aprendizagem estatística que são usados para calcular ou
aproximar funções que dependem de um grande número de entradas.
As
redes neurais são normalmente utilizadas quando o volume de entradas
é demasiado grande para as abordagens convencionais de aprendizagem
de máquina previamente discutidas.

Conclusão

Aprendizado de Máquina é um dos temas mais importantes para o estudo de Big Data e Ciência de Dados.
Assim, se você pretende seguir carreira nesta área, é bom começar a se familiarizar com estes conceitos o quanto antes.
Para saber mais, confira nossa palestra sobre Big Data e Ciência de Dados.
Mas devo registrar que não sou nenhum especialista neste assunto, sou curioso e tenho lido a respeito, então achei que este é um tema que vale a pena trazer pra você.

[Infográfico] Cientista de Dados em 8 Passos!

Que a carreira em Big Data e Ciência de Dados é uma das mais promissoras para os próximos anos, já não há mais dúvida.
A grande questão agora é como chegar lá.
Por isso, resolvi traduzir este excelente infográfico do BiCorner.com, que traz os 8 passos (fáceis) para uma carreira de cientista de dados.
Coloquei a palavra fáceis entre parênteses porque este é um adjetivo polêmico neste caso. A facilidade é relativa, e vai depender muito do quanto você está realmente disposto a agir efetivamente na direção de construir uma carreira em ciência de dados.
Estudo sobre Big Data e Ciência de Dados há alguns anos e ainda sinto que só consigo arranhar a superfície das possibilidades que este mercado oferece.
Aproveito pra deixar aqui uma provocação:
Você seria capaz de se comprometer, postando nos comentários o que pretende fazer com as dicas deste post?

Sinceramente, acho que a maioria vai ler isso aqui e não vai fazer nada a respeito.

Tenho visto ótimos exemplos de iniciativas na área de Big Data recentemente, mas ainda são poucos, infelizmente.

Como li outro dia no Clube dos Poupadores:
“É fácil ser o melhor em um mundo onde todo mundo faz mais do mesmo.“

Mas chega de provocar, e vamos ao que interessa (eita bordão cansado, hein? :).

Quais os passos para uma carreira de sucesso em Big Data e Ciência de Dados?

Passo 1 – Estudar Estatística, Matemática e Machine Learning

A base matemática e estatística é fundamental para compreender a maneira correta de analisar os dados.
Uma frase clássica diz que “Correlação não é Causalidade (Correlation is not Causation)“, e deixa claro que o fato de que dois dados se relacionam não significa que esta relação seja de dependência, de causa/consequência.
Este é um erro muito comum.

Passo 2 – Aprender a Programar

Não tem jeito. O mundo é movido a tecnologia. E a tecnologia movida a software. Sem o software, o hardware é apenas um conjunto de componentes eletrônicos sem “vida”.
Por isso, por mais que você seja “da minha turma”, aquele pessoal de infraestrutura que detesta(va) programar, é fundamental superar este trauma e rever os conceitos.
Somos cada dia mais demandados a automatizar coisas e lidar com situações em que um “scriptzinho” resolve de maneira bem melhor que uma interface gráfica.
Pense nisso.

Passo 3 – Conhecer sobre Bancos de Dados

Se vamos analisar dados, nada mais óbvio que entender como estes dados podem e devem ser organizados, armazenados, para obter o melhor resultado da análise.
O mercado de banco de dados sofreu uma transformação significativa nos últimos anos em razão das soluções baseadas em NoSQL (Not Only SQL).
Então é importante conhecer as alternativas para o armazenamento e análise de dados, sejam eles estruturados ou não.

Passo 4 – Dominar Visualização e Relatórios

De nada adianta fazer uma análise altamente complexa, sofisticada dos dados, se não souber apresentá-los da maneira correta.
Em razão disso, novas soluções surgiram recentemente para facilitar o processo de encontrar a melhor visualização para os dados e do resultado de sua análise.

Passo 5 – Eleve o Nível com as ferramentas para Big Data

Agora que você já domina a análise e visualização de dados, é hora de “escalar”.
As ferramentas para Big Data como Hadoop, Spark e outras foram pensadas para lidar com grandes volumes de dados, permitindo levar suas habilidades analíticas para outro nível.

Passo 6 – Pratique e faça Networking

Há muitos sites na web onde é possível encontrar profissionais de Big Data e Ciência de Dados com quem debater, compartilhar e aprender muito sobre Big Data.

Confira no infográfico alguns dos melhores “locais pra frequentar”.

Passo 7 – Busque Emprego

Isto muito provavelmente não será problema, se você seguir os passos anteriores corretamente.
A carência de profissionais especializados já é perceptível inclusive no Brasil, e isso só tende a se agravar à medida que mais e mais empresas percebam que a análise de dados é tão fundamental para seu negócio quanto o acesso à Internet.

Passo 8 – Participe da Comunidade

Quem acompanha o blog há mais tempo sabe que minha visão sobre sucesso na carreira é muito afetada pelo meu interesse em software livre.
O que nos leva à palavra mágica que todo profissional de TI deve dominar: colaboração.
Quando você colabora com um colega de trabalho frequentemente, se torna referência de conhecimento para ele.
Agora leve isso para uma comunidade de milhares, talvez milhões de usuários.
O que isso pode fazer pela sua carreira? #ficadica

O Infográfico

Tudo que descrevi acima está visualmente representado no infográfico abaixo.

Em especial, atente para os exemplos de soluções que vale a pena conhecer, à medida que avance na sua caminhada para uma carreira de sucesso em Big Data e Ciência de Dados.

Conclusão

Ainda parece fácil? Pois é.
Mas não se deixe abater.
Os desbravadores deste novo mercado serão (muito bem) recompensados.
Por isso repito aqui a provocação:

Você seria capaz de se comprometer, postando nos comentários o que pretende fazer com as dicas deste post?

Use o código abaixo para fazer o embed do documento no seu site, se desejar (substitua os colchetes por sinal de menor).


[iframe height=”480″ src=”https://drive.google.com/file/d/0B8C-amQE9A3mSF9XTkdyYm40X1U/preview” width=”640″][/iframe]

Para saber mais

  1. Baixe o ebook sobre soluções para Big Data que escrevi;
  2. Se inscreva na lista que criei para discutir o tema no Google Groups;
  3. Confira minha palestra virtual apresentando os conceitos básicos da tecnologia, depois venha trocar idéias!

Big Data para leigos – Parte 2

Seguimos com a Parte 2 da série… se não viu a Parte 1, clique aqui.

A Abordagem
Hadoop

Hadoop foi concebido para processar eficientemente grandes volumes de informação, ligando muitos computadores convencionais em conjunto para funcionar em paralelo.
A máquina de 1000 CPUs teórica descrita anteriormente custaria uma quantidade muito grande de dinheiro, muito mais do que 1.000 máquinas com uma única CPU ou 250 máquinas com 4 CPUs.
O Hadoop vai amarrar essas máquinas menores em um único cluster de computação de baixo custo.

Comparação com Técnicas Existentes

Processamento de grandes volumes de dados não é algo novo, tendo sido feito em configurações de sistemas distribuídos.
O que torna o Hadoop único
é o seu modelo de programação simplificado, que permite ao usuário
escrever e testar sistemas distribuídos de forma rápida e eficiente, além da distribuição automática de dados e uso do paralelismo subjacente dos
núcleos de CPU.
Outras abordagens sofrem com a necessidade de gerenciar redes SAN de forma isolada do cluster de
processamento, e a colaboração entre os vários nós de
computação deve ser controlada por um sistema de comunicação específico, além de usar um modelo de programação mais complexo que pode levar à introdução de erros.

Distribuição de Dados

Em um cluster
Hadoop, os dados são distribuídos para todos os nós.
O Hadoop Distributed File System
(HDFS) irá dividir grandes arquivos de dados em pedaços que são
geridos por diferentes nós do cluster.
Além disso, cada pedaço é
replicado através de várias máquinas, de modo que uma falha única
na máquina não resulta em indisponibilidade dos dados.
Um sistema de controle ativo replica dos dados em
resposta a falhas do sistema, o que pode resultar em armazenamento
parcial.
Mesmo que os pedaços de arquivos sejam replicados e
distribuídos através de várias máquinas, eles formam um único
espaço de nomes, para que seus conteúdos sejam universalmente
acessíveis.
O dado é
conceitualmente um registro orientado no contexto de programação do Hadoop.
Arquivos de entrada individuais são divididos em linhas ou em outros
formatos específicos para a lógica do aplicativo.
Como os arquivos
estão espalhados por todo o sistema de arquivos distribuídos em partes, cada processo de computação em execução em um nó opera sobre um subconjunto dos dados.
Os dados processados por cada nó são escolhidos com base em sua localidade, e a maioria dos dados
são lidos a partir do disco local direto para o CPU, aliviando a
pressão sobre a largura de banda de rede e impedindo as
transferências desnecessárias.
Esta estratégia de levar a computação para os dados, em vez de levar os dados para a computação, permite ao Hadoop alcançar níveis elevados de
processamento de dados locais, o que, por sua vez, resulta em alto desempenho.
Big Data para leigos - Parte 2 4
Os dados são distribuídos entre os nós em tempo de
carregamento.

Map Reduce: Processos Isolados

O Hadoop limita a
quantidade de comunicação que pode ser realizada pelos processos, e como cada registro individual é processado por tarefas isoladas.
Embora soe como limitação
no início, esta abordagem torna o processamento muito mais confiável. 
O Hadoop não toma todo o código e simplesmente distribui através de um
cluster.
O código deve ser escrito de acordo com um
modelo de programação particular, denominado “Map Reduce.”
Neste modelo, os registros são processados em isolamento por tarefas
chamadas Mappers.
A saída é, então, encaminhada para um
segundo conjunto de tarefas, chamadas Reducers, onde os resultados
de diferentes Mappers podem ser agrupados.
Big Data para leigos - Parte 2 5
Tarefas Map Reduce são executadas em nós onde os
registros de dados já estão presentes.

Nós separados de
um cluster Hadoop ainda se comunicam uns com os outros.
No entanto, em
contraste com sistemas distribuídos convencionais, onde os
desenvolvedores de aplicativos explicitam os fluxos de bytes de nó em nó em soquetes ou através de buffers, a
comunicação em Hadoop é realizada de forma implícita.
Partes dos dados podem ser marcadas com os nomes das chaves que informam ao Hadoop
como enviar os bits de informação relacionados para um nó de destino.
O Hadoop administra internamente todas as questões de
transferência de dados e de topologia do cluster.
Ao restringir a
comunicação entre nós, o Hadoop torna o sistema distribuído muito
mais confiável. 
Falhas de nós, individualmente, podem ser
contornadas reiniciando tarefas em outras máquinas.
Como as tarefas
em nível de usuário não se comunicam de forma explícita, não há mensagens que precisam ser trocadas pelas aplicações, nem nós que precisam realizar checkpoints e reiniciar parcialmente o processamento.
As outras tarefas continuam a operar como se nada tivesse acontecido, deixando os
aspectos desafiadores de reiniciar parcialmente a aplicação para a
camada subjacente do Hadoop.

Escalabilidade

Um dos principais
benefícios da utilização Hadoop em contraste com outros sistemas
distribuídos é a sua curva suave de escalabilidade.
Executar o Hadoop
em uma quantidade limitada de dados em um pequeno número de nós
pode não demonstrar um desempenho que chame a atenção, dada a
sobrecarga envolvida em iniciar uma aplicação Hadoop.
Outros paradigmas de programação distribuída e paralela,
como MPI (Message Passing Interface) podem atuar muito melhor em duas,
quatro, ou talvez uma dúzia de máquinas.
Embora o esforço de
coordenação do trabalho entre um pequeno número de máquinas seja melhor realizado por estes sistemas, o preço pago em desempenho
e engenharia (quando se adiciona mais hardware como
resultado do aumento do volume de dados) aumenta de forma não
linear.
Uma aplicação escrita em outras abordagens distintas do Hadoop pode exigir
grandes quantidades de refatoração quando se atinge escala de centena ou milhares de máquinas.
Isso pode envolver a reescrita da aplicação várias
vezes.
O Hadoop, por outro lado, é especificamente projetado para ter uma curva de
escalabilidade muito suave.
Depois que um programa Hadoop é escrito e
funciona em dez nós, muito pouco – talvez nenhum – esforço é
necessário para que o mesmo programa seja executado em uma
quantidade muito maior de nós.
Várias ordens de magnitude de
crescimento podem ser geridas com pouco retrabalho em suas aplicações.
A plataforma Hadoop subjacente irá gerir os
recursos de dados e hardware e oferecer desempenho confiável e crescimento proporcional ao número de máquinas disponíveis.

Conclusão

Como se pode ver, o Hadoop foi pensado para grandes aplicações distribuídas, tendo um foco em facilitar o crescimento da aplicação.
Isto é particularmente interessante no mundo atual, em que proliferam startups que podem ter crescimento muito acelerado, sendo o Hadoop, portanto, uma solução moderna, na medida em que se adequa às necessidades das empresas que mais crescem no mercado de TI atual.
Por outro lado, o Hadoop pode não ser a melhor opção para empresas cuja realidade não envolva crescimento e cujo volume de dados não demande clusters com centenas ou milhares de nós.
É fundamental, então, como em qualquer projeto de análise de dados, estar atento ao cenário atual e futuro da organização para determinar se o Hadoop representa a melhor alternativa em cada caso.
E você, o que pensa a respeito de escalabilidade ? Fala aí!

Ah! E se já leu o ebook e assistiu a palestra, não deixe de comentar aqui o que achou!

Big Data para leigos – parte 1

Ecossistema Hadoop - Ferramentas para Big Data
Há algum tempo atrás pedi a meu irmão pra me ajudar a traduzir um tutorial do Yahoo sobre Hadoop e outras ferramentas para Big Data, e este trabalho finalmente foi concluído.
Hoje começo uma série que vai te fornecer informação relevante sobre os softwares comumente usados em projetos de análise de grandes volume de dados, com destaque para o Hadoop.

Hadoop

O Hadoop é uma infraestrutura de processamento em lote distribuído em larga escala. Mesmo podendo ser usado em uma única máquina, o seu verdadeiro poder reside na sua capacidade de se adaptar a centenas ou milhares de computadores, cada um com vários núcleos de processador. 
O Hadoop também é projetado para distribuir eficientemente grandes quantidades de tarefas através de um conjunto de máquinas.
Mas o que é uma grande quantidade de tarefas?
Estou falando de ordens de magnitude maior do que os sistemas existentes. Centenas de gigabytes de dados pra começar.
Na verdade, o Hadoop foi construído para processar dados “em escala web”, da ordem de centenas de gigabytes a terabytes ou petabytes.
Nessa escala, é provável que o conjunto de dados de entrada não vá mesmo caber no disco rígido de um único computador, muito menos na memória.
Por isso o Hadoop inclui um sistema de arquivos distribuído que quebra os dados de entrada e envia frações dos dados originais para várias máquinas em seu cluster em  segurança.
Isso resulta processamento paralelo com todas as máquinas do cluster e cálculo dos resultados de saída da maneira mais eficiente possível.

Desafios em larga escala

Fazer computação em larga escala é difícil. Para trabalhar com esse volume de dados, é necessária a distribuição de partes do problema em várias máquinas para processamento paralelo. 
Sempre que são usadas ​​várias máquinas em cooperação, a probabilidade de falhas aumenta. Em um ambiente em uma a máquina, a falha não é algo que os projetistas de aplicações explicitamente se preocupam com muita frequência: se a máquina caiu, então não há nenhuma maneira para que o programa seja recuperado.
Em um ambiente distribuído, no entanto, falhas parciais são uma ocorrência esperada e comum. As redes podem experimentar falhas parciais ou totais, se switches e roteadores quebrarem.
Os dados podem não chegar a um determinado ponto no tempo devido ao congestionamento de rede inesperado.
Nós individuais de computação podem superaquecer, 
Podem ocorrer falhas no disco rígido, ou de falta de memória ou espaço em disco.
Os dados podem ser corrompidos, maliciosamente ou por erro de transmissão.
Várias implementações e versões de software cliente podem falar protocolos ligeiramente diferentes um do outro.
Clocks podem ficar dessincronizados, arquivos de bloqueio podem não ser liberados, as partes envolvidas em transações atômicas distribuídas podem perder sua conexão de rede, 
Em cada um desses casos, o resto do sistema distribuído deve ser capaz de se recuperar da falha ou condição transitória de erro e continuar a fazer progressos.
É claro que, na verdade, fornecer tais resiliências é um grande desafio de engenharia de software.
Diferentes sistemas distribuídos abordam especificamente certos modos de falha, enquanto se preocupam menos com os outros.
O Hadoop não fornece nenhum modelo de segurança, nem salvaguarda contra dados maliciosamente inseridos.
Ele não consegue detectar um ataque MITM, por exemplo.
Por outro lado, ele é projetado para lidar com questões de falha de hardware e situações de congestionamento de forma muito robusta.
Outros sistemas distribuídos podem ser usados para problemas com outros requisitos (alta segurança, por exemplo).
Além de se preocupar com esses tipos de erros e desafios, há também o fato de que o hardware tem recursos finitos. Os principais recursos incluem:
  • Tempo do processador
  • Memória
  • Espaço em disco
  • Largura de banda de rede

Máquinas individuais normalmente têm apenas alguns gigabytes de memória. Se o conjunto de dados de entrada é de vários terabytes, isso exigiria mil ou mais máquinas para manter os dados na memória RAM e, mesmo assim, nenhuma máquina seria capaz de processar ou tratar todos os dados.
Os discos rígidos são muito maiores; uma única máquina pode armazenar vários terabytes de informação em seus discos rígidos.
Mas o conjunto de dados intermediários gerados durante a execução de uma computação em larga escala pode facilmente multiplicar a ocupação de espaço em relação ao conjunto de dados de entrada original tinha ocupado.
Durante esse processo, alguns dos discos rígidos utilizados pelo sistema poderão ficar cheios, e o sistema distribuído pode precisar redirecionar esses dados para outros nós que possam armazenar o excesso.
Finalmente, a largura de banda é um recurso escasso, mesmo em uma rede interna.
Enquanto um conjunto de nós diretamente conectados por uma ethernet gigabit geralmente tem alta taxa de transferência entre eles, se todas as máquinas transmitirem conjuntos de dados multi-gigabyte, podem facilmente saturar a capacidade de largura de banda do switch.
Além disso, se as máquinas estão espalhadas por vários racks, a largura de banda disponível para a transferência de dados seria muito menor.
E mais, solicitações RPC e outros pedidos de transferência de dados usando este canal podem ser adiados ou descartados.
Para ser bem sucedido, um sistema distribuído em larga escala deve ser capaz de gerir os recursos acima mencionados de forma eficiente.
E deve atribuir alguns desses recursos para a manutenção do sistema como um todo, dedicando o máximo tempo possível para o cálculo real de processamento dos dados.
A sincronização entre várias máquinas continua a ser o maior desafio no projeto de sistemas distribuídos.
Se os nós de um sistema distribuído podem se comunicar de forma explícita, os projetistas de aplicatições devem estar cientes dos riscos associados a tais padrões de comunicação.
Torna-se muito maior o risco de gerar mais chamadas de procedimento remoto (RPC) do que o sistema pode suportar!
E a capacidade de continuar o cálculo em caso de falhas torna-se mais difícil.
Por exemplo, se há 100 nós presentes em um sistema e um deles falha, os outros 99 nós devem ser capazes de continuar a computação, de preferência, com apenas uma pequena penalização proporcional à perda de 1% do poder de computação.
Naturalmente, isto irá exigir que a computação de qualquer trabalho perdido seja possível.
Além disso, se há uma complexa rede de comunicação sobre a infraestrutura  distribuída, determinar a melhor forma de reiniciar o cálculo do nó que falhou e propagar esta informação sobre a mudança na topologia da rede pode ser não trivial de implementar.

A lei de Moore

Então, por que usar um sistema distribuído? Eles parecem trazer mais problemas do que soluções. E com o ritmo acelerado do projeto de hardware, parece inevitável que o hardware de um único chip seja capaz de “crescer” para lidar com os volumes maiores de dados.
Afinal de contas, a Lei de Moore (em homenagem a Gordon Moore, fundador da Intel) afirma que o número de transistores que podem ser colocados em um processador irá duplicar aproximadamente a cada dois anos, pela metade do custo.
Mas as tendências em projeto de chips estão mudando para enfrentar novas realidades. Enquanto ainda é possível dobrar o número de transistores por unidade de área nesse ritmo, isso não necessariamente resulta em um desempenho  mais rápido.
Novos processadores e arquiteturas agora se concentrar em incorporar muitas CPUs menores ou “núcleos” para o mesmo dispositivo físico.
Isso permite processar duas vezes mais dados em paralelo, com a mesma velocidade em que operava anteriormente.
Mesmo se centenas ou milhares de núcleos são colocados numa máquina única, não seria possível entregar os dados de entrada para esses núcleos suficientemente rápido para processamento.
Discos rígidos individuais só podem sustentar velocidades de leitura entre 60-100 MB/segundo.
Estas velocidades têm vindo a aumentar ao longo do tempo, mas não no mesmo ritmo alucinante como processadores.
Sendo otimista e assumindo o limite máximo de 100 MB/segundo, e assumindo quatro canais independentes disponíveis para a máquina, temos 400 MB de dados a cada segundo.
Um conjunto de dados 4 terabyte levaria, portanto, mais de 10.000 segundos para ser lido – cerca de três horas apenas para carregar os dados.
Com 100 máquinas separadas, cada uma com dois canais, isso cai para três minutos.

A Abordagem Hadoop

Hadoop foi concebido para processar eficientemente grandes volumes de informação, ligando muitos computadores convencionais em conjunto para funcionar em paralelo.
A máquina de 1000 CPU teóricos descritos anteriormente custaria uma quantidade muito grande de dinheiro, muito mais do que 1.000 máquinas com uma única CPU ou 250 máquinas com 4 CPUs.
O Hadoop vai amarrar essas máquinas menores em um único cluster de computação de baixo custo.

Conclusão

Entendo que o Hadoop é uma demonstração clara da aplicabilidade de sistemas distribuídos na solução de problemas que envolvam alto volume de dados, o que se torna cada vez mais comum atualmente.
Assim, entender os desafios e as soluções representadas pelo Hadoop e seu ecossistema é fundamental para quem deseja estar preparado para resolver os problemas enfrentados pelas organizações hoje.
Quer saber mais ? Confira o ebook que preparei, e confira esta palestra gratuita!
Em breve a parte 2… aguarde e confira 🙂

14 Grupos TOP do LinkedIn e Facebook para ampliar seus conhecimentos em Big Data e Ciência de Dados (mesmo que esteja partindo do zero!)

Grupos TOP do LinkedIn e Facebook sobre Big Data e Ciência de Dados
Se interessa por Big Data, Analytics, Ciência de Dados e assuntos correlatos ?
Então saiba que é importante saber onde obter informação de qualidade sobre estes temas.
Por isso resolvi relacionar alguns grupos que pesquisei e descobri no LinkedIn e Facebook que podem te ajudar a dar aquele salto na carreira.
Vamos a eles!

LinkedIn

Recomendo os grupos do LinkedIn por se tratar de uma rede social mais profissional, e portanto menos sujeita a lixo.
Vale notar que alguns destes grupos são fechados, o que pode representar o risco de não ser aceito.
Advanced Business Analytics, Data Mining and Predictive Modeling
Business Intelligence Professionals (BI, Big Data, Analytics)
Statistics & Analytics Consultants Group
Big Data, Analytics, Hadoop, NoSQL & Cloud Computing
Data Warehouse / Big Data / Hadoop / Predictive Analytics
IBM Big Data and Analytics
Data Science & Machine Learning
Predictive Analytics

Facebook

Embora o Facebook tenha mais lixo, não dá pra ignorar que a maioria das pessoas está lá, por isso o alcance destes grupos acaba sendo maior.
Big Data Beginners
Big Data Brasil
Big Data
Big Data, Hadoop, NoSQL, Analytics News
BigData Hadoop Questions, Certification Dumps & Discussion
Big Data, Data Science, Data Mining & Statistics

Conclusão

Eu fico realmente impressionado como as discussões sobre Big Data ainda são restritas no Brasil.
A maioria dos grupos acima contém exclusivamente material em inglês, e mesmo os que contém material em português, este conteúdo é minoria.
Eu prefiro os grupos do LinkedIn não apenas pelo caráter mais profissional, mas pela facilidade de receber por email as discussões, não sendo necessário ficar “pendurado” na rede social pra acompanhar o que acontece no grupo.
Espero que possam aproveitar a avalanche de conteúdo oferecida pelos grupos, e se preparar pra este mercado que deve crescer nos próximos anos, e que já paga R$ 15 mil!
E caso tenha dificuldade com o inglês, seja iniciante no tema “Big Data” ou queira mais ajuda para seus projetos, não deixe de conferir a Palestra Gratuita e o ebook que preparei pra você.
E então? Deixa seu comentário aqui sobre os grupos que indiquei!

Big Data é uma piada (não é o que você está pensando!)

Há muita controvérsia em torno da tecnologia de Big Data.
Há quem desdenhe.
Há quem desconfie.
Há quem acredite.
Há quem aplique.
Há até quem não está nem aí.
Seja qual for seu interesse na tecnologia, acredito que vai se divertir (quem sabe até refletir) com as imagens a seguir. Confira!
Big Data é como sexo na adolescência: todo mundo fala, ninguém realmente sabe como fazer, todo mundo pensa que todo mundo está fazendo, então todo mundo diz que está fazendo. :)
Big Data é como sexo na adolescência: todo mundo fala, ninguém realmente sabe como fazer, todo mundo pensa que todo mundo está fazendo, então todo mundo diz que está fazendo. 🙂

Muita gente se preocupando em obter dados sem sequer saber o que fazer com eles. Cômico ou trágico ?
Muita gente se preocupando em obter dados sem sequer saber o que fazer com eles. Cômico ou trágico ?

Criar meios de analisar os dados e extrair informação útil para tomada de decisão é o grande desafio! Não adianta pressa.
Criar meios de analisar os dados e extrair informação útil para tomada de decisão é o grande desafio! Não adianta pressa.

A coleta de dados cada vez mais presente nos serviços que usamos na Internet faz com que seja cada vez mais difícil se esconder. A Internet não é terra de ninguém faz tempo.
A coleta de dados cada vez mais presente nos serviços que usamos na Internet faz com que seja cada vez mais difícil se esconder. A Internet não é terra de ninguém faz tempo.

Separar o joio do trigo não é fácil!
Separar o joio do trigo não é fácil!

Em breve numa barraca de frutas perto de você :)
Em breve numa barraca de frutas perto de você 🙂

Complicado colocar esses dados na nuvem, hein ?
Complicado colocar esses dados na nuvem, hein ?

Facebook = CIA, ou "O espião é você mesmo" :)
Facebook = CIA, ou “O espião é você mesmo” 🙂

23,5% bem vindo é ótimo!!!
23,5% bem vindo é ótimo!!!

Só eu lembrei da Alemanha ? :(
Só eu lembrei da Alemanha ? 🙁

O hype em torno do termo é grande, mas vai passar, afinal isso sempre acontece com novas tecnologias, embora haja quem defenda que de novo o Big Data não tem nada. Enfim...

Conclusão

O hype em torno do termo é grande, mas vai passar, afinal isso sempre acontece com novas tecnologias, embora haja quem defenda que de novo o Big Data não tem nada.
Enfim…
De todo modo, acredito que a hora de aproveitar é agora, até porque o processo de adoção está lento no Brasil, pois depois que virar commodity… aí será tarde pra alavancar sua carreira usando o hype como trampolim.
E aí, curtiu as imagens ? Tem alguma pra compartilhar ? Manda aí!

Quer saber mais? Baixe o ebook gratuito que preparei pra você.

[Infográfico] Big Data em Números – O que você precisa saber!

Big Data é o hype do momento, acho que isso todo mundo já sabe.
Ocorre que, mais que um simples modismo, é uma oportunidade.
E que oportunidade!
Oportunidade pras empresas, que tendo acesso a um volume maior de dados, podem fazer análises mais completas e confiáveis.
Oportunidade pra profissionais qualificados, que podem aproveitar a demanda que surge com a novidade (mesmo que não seja tão novidade assim :).
E é pra dar uma idéia mais clara dessa oportunidade que resolvi trazer pra você o primeiro infográfico do Tecnologia que Interessa!, que, baseado nas previsões do Gartner, apresenta números impressionantes, que deixam claro o quanto a tecnologia associada ao fenômeno Big Data está mudando a realidade das empresas.
Confira!
[Infográfico] Big Data em Números - O que você precisa saber! 6
Quero destacar o fato de que, ainda que lentamente, as empresas começam a investir em Big Data aqui no Brasil, e estima-se que este mercado chegue a R$ 1 bilhão até 2018 (este ano R$ 680 milhões).

Nada mal, hein ?

Outra coisa que merece atenção é o fato de que a tecnologia se aplica a qualquer segmento, seja indústria, serviços financeiros, comunicação e mídia ou governo. Observe como o investimento aumenta em ritmo acelerado a cada ano.

Note ainda que os resultados são bem claros: 2x mais chance de aumentar o desempenho financeiro, 5x mais chance de ser mais rápida que a concorrência, 3x mais chance de melhorar o planejamento.

Definitivamente, não dá pra ignorar uma tecnologia que proporciona benefícios como estes, não acha?

Conclusão

Não canso de dizer que Big Data é uma oportunidade pra você, profissional de TI, que quer (precisa?) dar um salto na carreira, saindo na frente, sendo pioneiro e abraçando com todas as forças a inovação.

E eu estou aqui pra ajudar no que puder, basta entrar em contato.

Aproveito pra divulgar a lista Big Data Brasil, que criei há alguns meses pra trocar idéias sobre o tema, e convido você a participar. Já rolaram várias discussões legais por lá!

E então, o que achou do infográfico ? Se curtiu, compartilha aí!

Para saber mais

  1. Baixe o ebook sobre soluções para Big Data que escrevi;
  2. Se inscreva na lista que criei para discutir o tema no Google Groups;
  3. Confira minha palestra virtual apresentando os conceitos básicos da tecnologia, depois venha trocar idéias!

8 fortes tendências para Big Data Analytics

Tendências Big Data Analytics
Como acontece com qualquer nova tecnologia, as soluções para Big Data Analytics começaram a apresentar sinais de amadurecimento, e isto se reflete numa oferta de mais e melhores opções para analisar os dados das empresas aliando desempenho, usabilidade e segurança.
Analiso a seguir as 8 tendências apontadas pelo CIO.

1 – Big Data Analytics na nuvem

Embora desenvolvido inicialmente para funcionar com clusters de máquinas físicas, o Hadoop evoluiu, e muitos provedores oferecem opções para processamento de dados na nuvem, a exemplo de Amazon (Redshift e Kinesis), Google (Big Query) e IBM (Bluemix).
Há alguma controvérsia sobre os custos de utilizar soluções na nuvem para processar volumes muito grandes de dados (petabytes e acima), mas acredito num ajuste do mercado para que as ofertas de soluções na nuvem sejam atrativas mesmo para cenários mais “agressivos” de análise de dados.
Quando se trata de volumes menores de dados, a nuvem é a melhor opção, pois processar 1 TB de dados pode custar a partir de 25 dólares. Nada mal hein ?

2 – Hadoop, o sistema operacional corporativo para dados

O Hadoop atualmente suporta alternativas ao Map/Reduce, e as versões mais recentes oferecem mais recursos para escalabilidade, desempenho e segurança, além de facilidades que estão tornando cada vez mais simples utilizar as ferramentas, transformando o Hadoop no S.O. para dados “de fato”, o que deve se refletir numa adoção mais acelerada de agora em diante.
Integração com SQL, dados em memória, processamento de streamming, grafos e muitos outros tipos de processamentos de dados já são suportados, tornando a solução genérica o suficiente para ser útil aos mais diversos segmentos de mercado.

3 – Big Data Lakes

Comecei a ver este termo citado com mais frequência na mídia, significando que há um movimento de utilizar o Hadoop como “repositório gigante de dados”, ou seja, as empresas podem simplesmente “despejar” seus dados neste repositório, e construir gradativamente os esquemas necessários para acesso aos dados disponíveis.
Por um lado, isso reduz a necessidade de todo um trabalho prévio de modelagem antes de ser possível analisar os dados. Por outro, exige mais conhecimento para construir esquemas para acesso aos dados à medida que se tornam necessários, sob demanda, num processo incremental.

4 – Mais Análises Preditivas

Com as tecnologias para Big Data, a possibilidade de analisar mais dados implica também na possibilidade de analisar mais atributos, variáveis, metadados e registros, permitindo otimizar as amostras utilizadas em análises estatísticas e aumentando a capacidade de fazer previsões a partir dos dados.
O fato de não ter restrições de poder computacional faz uma diferença muito grande, segundo especialistas, permitindo formular os problemas de maneiras diferentes e viabilizando análises que antes eram impossíveis.

5 – SQL integrado ao Hadoop

As ferramentas que permitem o suporte à linguagem SQL com Hadoop estão evoluindo muito rapidamente, como todo o ecossistema Big Data, tanto em quantidade quanto qualidade, especialmente desempenho.
Isto é importante porque representa a possibilidade de utilizar uma linguagem que o mercado já conhece, mas dentro de um novo contexto, com novas possibilidades, o que simplifica o uso das novas soluções baseadas em Hadoop, reduzindo o investimento necessário em treinamento, por exemplo.
Embora o Hive continue evoluindo, especialista apontam que alternativas desenvolvidas pela Cloudera, Pivotal, IBM e outros fornecedores oferecem melhor desempenho, facilitando a análise interativa.

6 – Mais e melhores opções NoSQL

NoSQL não é nenhuma novidade pra quem acompanha o blog. Especialistas estimam entre 15 e 20 soluções Open Source NoSQL populares, cada uma com sua especialidade.
Soluções baseadas em grafos que facilitam a análise de redes de relacionamentos, ou especializadas em tratar fluxos de dados (streamming) de sensores ou redes sociais como Twitter, estão sendo integradas ao ecossistema Hadoop.

7 – Deep Learning

A combinação de técnicas de aprendizado de máquina conhecida como Deep Learning e que se baseia em redes neurais está evoluindo, e especialistas apontam grande potencial para a solução de problemas relacionados a negócios.
Identificar relações entre dados, ou destacar aqueles mais relevantes dentre um grande volume de informações são algumas das possibilidades que a técnica oferece, sem a necessidade de modelos especializados ou instruções através de códigos e programação.
Um exemplo muito interessante envolveu a aplicação de um algoritmo de Deep Learning para examinar dados da Wikipedia, tendo como resultado o aprendizado “por conta própria” de que Califórnia e Texas são estados dos EUA.

8 – Analytics em memória

O uso de bancos de dados em memória é cada vez maior, como demonstra a popularidade de soluções como Qlikview e Tableau, pois estas soluções, se usadas da maneira correta, podem trazer muitos benefícios às empresas através do chamado Hybrid Transaction/Analytical Processing (HTAP).
Mas tem gente usando errado, especialistas advertem. Estas soluções não são a melhor opção para lidar com dados que não mudam com frequência ou que não precisam ser analisados de muitas formas diferentes em tempo real. Nesse caso, é um desperdício de dinheiro.
O Spark é uma solução muito promissora que fornece a possibilidade de manipular grandes volumes de dados usando técnicas de armazenamento em memória de maneira análoga ao que o Map/Reduce faz em disco, e assim oferecendo uma alternativa às soluções tradicionais de bancos de dados em memória.

Conclusão

Do que tenho acompanhado, vejo claramente que (nunca antes na história deste planeta 🙂 uma tecnologia foi tão rapidamente assimilada pelo mercado como estas relacionadas ao Big Data.
A evolução das ferramentas e o crescimento do ecossistema Hadoop ocorre na velocidade da luz, trazendo cada vez mais facilidades para uso da tecnologia pelas empresas.
Por isso, entendo que o recado é muito claro: a hora de começar a aprender, experimentar e adotar a tecnologia é agora, pois em breve o Hadoop vai virar commodity, e a vantagem competitiva para o profissional de TI que busque uma carreira nesta área desaparecerá.
Do ponto de vista das organizações, entendo que é hora de planejar iniciativas para 2015 que contemplem a utilização da tecnologia, e sugiro começar utilizando soluções mais simples de implementar, seja através de uma máquina virtual da Cloudera ou com o serviço EMR da Amazon.

Para saber mais

  1. Baixe o ebook sobre soluções para Big Data que escrevi;
  2. Se inscreva na lista que criei para discutir o tema no Google Groups;
  3. Confira minha palestra virtual apresentando os conceitos básicos da tecnologia, depois venha trocar idéias!

Salvando vidas e economizando com Big Data

Salvando vidas e economizando com Big Data 7
Em mais um exemplo claro do “poder” do Big Data, neste caso com uma ênfase muito importante para o aspecto da “Ciência de Dados” (Data Science para os gringos), um projeto desenvolvido pelo Centro de Ciência de Dados da Universidade de Washington está sendo usado num hospital com muito sucesso!
O projeto, chamado Risk-O-Matic, utiliza técnicas de aprendizado de máquina para prever, através de um indicador de risco, se um paciente que acabou de passar por um tratamento vai retornar ao hospital em pouco tempo (menos de 30 dias, por exemplo) por conta do mesmo problema, dentre outras possibilidades.
Para isso são usados muitos dados sobre o histórico médico e perfil do paciente compostos por mais de 100 atributos, que são analisados através de aplicações web e móveis.
Este tipo de projeto é de especial interesse do governo dos EUA e dos hospitais de lá por conta do famoso Obamacare, o programa de saúde que remunera hospitais com base na melhora dos indicadores de saúde, cujos custos chegam a 15 bilhões/ano apenas por conta do retorno aos hospitais, em menos de 30 dias, de 25% dos pacientes que acabaram de passar por tratamentos cardíacos. A idéia do governo é remunerar melhor hospitais que ajudarem a melhorar estes indicadores.
O projeto é ainda mais promissor por se tratar de iniciativa genérica, que pode ser aproveitada por qualquer governo, hospital, etc, de forma que os pesquisadores estão estudando montar uma empresa pra comercializar a solução, que também pode ser integrada a outras soluções médicas do mercado.
Fico cada vez mais fascinado por este novo mundo de possibilidades que se apresenta a partir das tecnologias de Big Data.
Quer conversar mais a respeito deste fascinante tema ? Deixe seu comentário aqui!
Via GigaOM.

Agora você tem uma importante decisão a tomar.
Aprender mais sobre Big Data e se diferenciar no mercado, ou simplesmente fechar esta janela e desperdiçar a oportunidade de crescimento profissional. 
A escolha é sua!
Seja sábio!