Vinte anos de Amazon S3 e construindo o que vem por aí


Vinte anos de Amazon S3 e construindo o que vem por aí

Há vinte anos, em 14 de março de 2006, Serviço de armazenamento simples da Amazon (Amazon S3) lançado discretamente com um modesto anúncio de um parágrafo sobre o Página Novidades:

Amazon S3 é armazenamento para a Web. Ele foi projetado para tornar a computação em escala internet mais fácil para os desenvolvedores. O Amazon S3 fornece uma interface simples de serviços internet que pode ser usada para armazenar e recuperar qualquer quantidade de dados, a qualquer momento, de qualquer lugar na internet. Ele dá a qualquer desenvolvedor acesso à mesma infraestrutura de armazenamento de dados altamente escalável, confiável, rápida e barata que a Amazon usa para administrar sua própria rede international de websites.

Até Postagem do weblog de Jeff Barr foram apenas alguns parágrafos, escritos antes de pegar um avião para um evento de desenvolvedores na Califórnia. Nenhum exemplo de código. Nenhuma demonstração. Alarde muito baixo. Ninguém sabia na época que esse lançamento moldaria toda a nossa indústria.

Os primeiros dias: blocos de construção que simplesmente funcionam

Basicamente, o S3 introduziu duas primitivas simples: PUT para armazenar um objeto e GET para recuperá-lo posteriormente. Mas a verdadeira inovação foi a filosofia por trás disso: criar blocos de construção que lidam com o trabalho pesado indiferenciado, o que liberou os desenvolvedores para se concentrarem em trabalhos de nível superior.

Desde o primeiro dia, o S3 foi guiado por cinco fundamentos que permanecem inalterados até hoje.

Segurança significa que seus dados estão protegidos por padrão. Durabilidade foi projetado para 11 noves (99,999999999%) e operamos o S3 sem perdas. Disponibilidade é projetado em todas as camadas, com a suposição de que a falha está sempre presente e deve ser tratada. Desempenho é otimizado para armazenar praticamente qualquer quantidade de dados sem degradação. Elasticidade significa que o sistema aumenta e diminui automaticamente à medida que você adiciona e take away dados, sem necessidade de intervenção guide.

Quando acertamos essas coisas, o serviço se torna tão simples que a maioria de vocês nunca precisa pensar sobre o quão complexos são esses conceitos.

S3 hoje: escala além da imaginação

Ao longo de 20 anos, a S3 permaneceu comprometida com seus fundamentos básicos, mesmo quando cresceu a uma escala difícil de compreender.

Quando o S3 foi lançado pela primeira vez, ele oferecia aproximadamente um petabyte de capacidade whole de armazenamento em cerca de 400 nós de armazenamento em 15 racks abrangendo três information facilities, com 15 Gbps de largura de banda whole. Projetamos o sistema para armazenar dezenas de bilhões de objetos, com tamanho máximo de objeto de 5 GB. O preço inicial period de 15 centavos por gigabyte.

Ilustração das principais métricas do S3

Hoje, o S3 armazena mais de 500 trilhões de objetos e atende mais de 200 milhões de solicitações por segundo globalmente em centenas de exabytes de dados em 123 zonas de disponibilidade em 39 regiões da AWS, para milhões de clientes. O o tamanho máximo do objeto aumentou de 5 GB para 50 TBum aumento de 10.000 vezes. Se você empilhasse todas as dezenas de milhões de discos rígidos S3 uns sobre os outros, eles chegariam à Estação Espacial Internacional e quase voltariam.

Mesmo que o S3 tenha crescido para suportar essa escala incrível, o preço pago caiu. Hoje, a AWS cobra um pouco mais 2 centavos por gigabyte. Isso representa uma redução de preço de aproximadamente 85% desde o lançamento em 2006. Paralelamente, continuamos a introduzir formas de otimizar ainda mais os gastos com armazenamento com níveis de armazenamento. Por exemplo, nossos clientes economizaram coletivamente mais de US$ 6 bilhões em custos de armazenamento usando Camadas inteligentes do Amazon S3 em comparação com Padrão Amazon S3.

Nas últimas duas décadas, API S3 foi adotado e usado como ponto de referência em toda a indústria de armazenamento. Vários fornecedores agora oferecem ferramentas e sistemas de armazenamento compatíveis com S3, implementando os mesmos padrões e convenções de API. Isso significa que as habilidades e ferramentas desenvolvidas para o S3 são frequentemente transferidas para outros sistemas de armazenamento, tornando o cenário de armazenamento mais amplo mais acessível.

Apesar de todo esse crescimento e adoção pela indústria, talvez a conquista mais notável seja esta: o código que você escreveu para o S3 em 2006 ainda funciona hoje, inalterado. Seus dados passaram por 20 anos de inovação e avanços técnicos. Migramos a infraestrutura por meio de múltiplas gerações de discos e sistemas de armazenamento. Todo o código para lidar com uma solicitação foi reescrito. Mas os dados que você armazenou há 20 anos ainda estão disponíveis hoje e mantivemos a compatibilidade retroativa completa da API. Esse é o nosso compromisso de fornecer um serviço que “simplesmente funciona” continuamente.

A engenharia por trás da escala

O que torna o S3 possível nesta escala? Inovação contínua em engenharia.

Muito do que se segue foi extraído de uma conversa entre Mai-Lan Tomsen Bukovec, vice-presidente de dados e análises da AWS, e Gergely Orosz de O Engenheiro Pragmático. O entrevista aprofundada vai mais fundo nos detalhes técnicos para quem quer se aprofundar. Nos parágrafos seguintes, compartilho alguns exemplos:

No centro da durabilidade do S3 está um sistema de microsserviços que inspeciona continuamente cada byte em toda a frota. Esses serviços de auditoria examinam os dados e acionam automaticamente sistemas de reparo no momento em que detectam sinais de degradação. O S3 foi projetado para não ter perdas: a meta de design dos 11 noves reflete como o fator de replicação e a frota de re-replicação são dimensionados, mas o sistema é construído para que os objetos não sejam perdidos.

Engenheiros S3 usam métodos formais e raciocínio automatizado na produção para provar matematicamente a correção. Quando os engenheiros fazem check-in do código no subsistema de índice, as provas automatizadas verificam se a consistência não regrediu. Esta mesma abordagem prova a correção em replicação entre regiões ou para políticas de acesso.

Nos últimos 8 anos, a AWS reescreveu progressivamente o código crítico para o desempenho no caminho de solicitação S3 em Rust. A movimentação de blobs e o armazenamento em disco foram reescritos e o trabalho está em andamento em outros componentes. Além do desempenho bruto, o sistema de tipos do Rust e as garantias de segurança da memória eliminam lessons inteiras de bugs em tempo de compilação. Esta é uma propriedade essencial ao operar na escala S3 e nos requisitos de correção.

O S3 é baseado em uma filosofia de design: “A escala é uma vantagem”. Os engenheiros projetam sistemas para que o aumento da escala melhore os atributos para todos os usuários. Quanto maior o S3, mais descorrelacionadas se tornam as cargas de trabalho, o que melhora a confiabilidade para todos.

Esperando ansiosamente

A visão do S3 vai além de ser um serviço de armazenamento para se tornar a base common para todos os dados e cargas de trabalho de IA. Nossa visão é simples: você armazena qualquer tipo de dado uma vez no S3 e trabalha com ele diretamente, sem mover dados entre sistemas especializados. Essa abordagem reduz custos, elimina a complexidade e elimina a necessidade de múltiplas cópias dos mesmos dados.

Aqui estão alguns lançamentos de destaque dos últimos anos:

  • Tabelas S3 – Tabelas Apache Iceberg totalmente gerenciadas com manutenção automatizada que otimizam a eficiência das consultas e reduzem os custos de armazenamento ao longo do tempo.
  • Vetores S3 – Armazenamento de vetores nativo para pesquisa semântica e RAG, suportando até 2 bilhões de vetores por índice com latência de consulta inferior a 100 ms. Em apenas cinco meses (julho a dezembro de 2025), você criou mais de 250 mil índices, ingeriu mais de 40 bilhões de vetores e realizou mais de 1 bilhão de consultas.
  • Metadados S3 – Metadados centralizados para descoberta instantânea de dados, eliminando a necessidade de listar recursivamente grandes buckets para catalogação e reduzindo significativamente o tempo de obtenção de insights para grandes information lakes.

Cada uma dessas capacidades opera na estrutura de custos S3. Você pode lidar com vários tipos de dados que tradicionalmente exigiam bancos de dados caros ou sistemas especializados, mas que agora são economicamente viáveis ​​em escala.

De 1 petabyte a centenas de exabytes. De 15 centavos a 2 centavos por gigabyte. Do simples armazenamento de objetos à base para IA e análises. Apesar de tudo isso, nossos cinco fundamentos – segurança, durabilidade, disponibilidade, desempenho e elasticidade – permanecem inalterados, e seu código de 2006 ainda funciona hoje.

Um brinde aos próximos 20 anos de inovação em Amazon S3.

– seb

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *