flickr / Robert Scoble
e respaldo financeiro para fazer algo diferente e inovador, vai
acabar fazendo o que todo mundo está fazendo.
Todo
mundo pensa que está fazendo algo especial com estas novas
tecnologias de Big Data, mas não demora muito para encontrar os
mesmos padrões. Alguns casos específicos podem diferir um pouco,
mas aqui estão os sete projetos mais
comuns.
Projeto
1: Consolidação de Dados
pretende realizar a análise através deles.
consiste em obter dados de todas as fontes (em tempo real ou em lote)
e carregá-los no Hadoop.
tornar uma “empresa controlada por dados”; Às vezes você
simplesmente quer relatórios bonitos.
tabelas no Hive ou Impala. O futuro é armazenar e gerenciar os dados
no HBase e Phoenix, uma vez que o Hive é mais lento.
vendedores gostam de dizer coisas como “esquema de leitura”,
mas na verdade, para ter sucesso, você deve ter em mente quais serão
seus casos de uso (o Hive não é tão diferente de um Data Warehouse).
escalabilidade horizontal e custo muito mais baixo do que Teradata ou
Netezza.
Tableau e o Excel no front-end. Empresas mais sofisticadas com
“cientistas de dados reais” usam Zeppelin ou iPython Notebook como front-end.
Projeto
2: Análise Especializada
projetos de consolidação de dados efetivamente começam aqui, onde
você tem uma necessidade especial de carregar um conjunto de dados
para um sistema que faz algum tipo de análise.
domínios específicos, tais como risco de liquidez/simulações de
Monte Carlo em um banco.
dependiam de pacotes proprietários, antiquados, que não poderiam se
igualar como os dados faziam e frequentemente sofriam de um conjunto
limitado de funcionalidades (em parte porque o fornecedor do software
não poderia saber tanto sobre o domínio como a instituição imersa
nele).
mundos Hadoop e Spark, estes sistemas verificam praticamente o mesmo
que os sistemas de consolidação de dados, mas muitas vezes têm
mais HBase, código NoSQL customizado e menos fontes de dados (talvez apenas uma). Cada vez mais, eles são baseados no Spark.
Projeto
3: Hadoop como um Serviço
especializadas” (e, ironicamente, um ou dois projetos de
“consolidação de dados”) que, inevitavelmente, vai
começar a sentir a “alegria” (isto é, dor) de gerenciar
alguns clusters Hadoop diferentemente configurados, muitas vezes, de
diferentes fornecedores.
devêssemos consolidar essa situação e reunir recursos”, ao
invés de ter a metade de seus nós ociosos pela metade do tempo.
Eles poderiam ir para a nuvem, mas muitas empresas não podem ou não
querem, muitas vezes para a sua própria segurança (leia-se: a
política interna da organização).
monte de receitas prontas e posteriormente contêineres de pacotes
Docker.
solução “fora da caixa”, que também vai apelar para
organizações menores que carecem de recursos para implantar o
Hadoop como um serviço.
Projeto
4: Análise de Streaming
pessoas chamam isso de “streaming“, mas análise de streaming é bastante diferente do streaming tradicional a que estamos
acostumados.
em tempo real do que em lotes. Detecção de fraudes ou lavagem de
dinheiro: por que não fazer isso na base da transação e pegá-la
enquanto está processando, em vez de no final de um ciclo? O mesmo
vale para a gestão de inventário ou qualquer outra coisa.
alguns casos, este é um novo tipo de sistema transacional que
analisa dados bit a bit como em um sistema de análise em paralelo.
Esses sistemas se manifestam como Spark ou Storm com HBase
(armazenamento de dados mais usual).
não substitui todas as formas de análise; você ainda vai querer
procurar tendências históricas ou verificar dados do passado para
considerar algo que antes não tinha importância.
Projeto
5: Processamento de Eventos Complexos
estamos falando de processamento de eventos em tempo real, onde
milissegundos importam.
alta qualidade de ultra baixa latência (pico segundos ou nano
segundos), você pode esperar tempos de resposta em milissegundos.
exemplos incluem a classificação em tempo real de registros de
dados de chamadas para empresas de telecomunicações ou processamento de eventos da Internet das coisas.
esses sistemas usam o Spark e HBase, mas em geral eles são
convertidos para o Storm.
passado, esses sistemas foram baseados em software de mensagens
customizados – ou de alto desempenho, de prateleira, produtos de
mensagens cliente-servidor – mas os volumes de dados de hoje são
maiores para qualquer um.
pessoas com celulares dispararam desde que esses sistemas legados
foram criados, além do que sensores médicos e industriais drenam
muitos bits.
e mais rápido do que o Storm.
Projeto
6: Streaming como ETL
vezes você quer capturar dados de streaming e armazená-los em algum
lugar. Esses projetos geralmente coincidem com o número 1 ou número
2, citados acima, mas com seu próprio escopo e características.
(Algumas pessoas pensam que estão fazendo os projetos 4 ou 5 mas, na
verdade, elas estão armazenando em disco para analisar mais tarde).
usado, mas sem justificativa, a menos que você precise fazer
análise em memória.
Projeto
7: Substituir ou Aumentar SAS
é bom, mas também é caro e nós não estamos comprando caixas para
todos os cientistas e analistas de dados brincarem com os dados.
disso, você quer fazer algo diferente do que a SAS pode fazer ou
gerar um gráfico mais bonito. Aqui está o seu belo “Data Lake”.
Aqui está o iPython Notebook ou Zeppelin. Vamos
preencher os resultados em SAS e armazenar resultados do SAS aqui.
irá reconhecê-los.
você é um veterano com muito medo do “Big” em Big Data
ou do Hadoop, não se preocupe. Quanto mais as
coisas mudam, mais elas permanecem iguais. Você vai encontrar muitas
semelhanças entre o material usado para implantar e as tecnologias
modernas que giram em torno da Hadooposfera.
Conclusão
Para saber mais
- Baixe o ebook sobre soluções para Big Data que escrevi;
- Se inscreva na lista que criei para discutir o tema no Google Groups;
- Confira minha palestra virtual apresentando os conceitos básicos da tecnologia, depois venha trocar idéias!













![[Infográfico] Big Data em Números - O que você precisa saber! 12 [Infográfico] Big Data em Números - O que você precisa saber! 6](https://i0.wp.com/blog.tecnologiaqueinteressa.com/wp-content/uploads/2015/02/Infogr%C3%A1ficoBigDataemN%C3%BAmeros-TecnologiaqueInteressa.png?w=660&ssl=1)

