Traduzido do inglês

Empresário chinês que fundou o laboratório de IA DeepSeek a partir do fundo de hedge quantitativo High-Flyer, lançando o modelo de raciocínio DeepSeek-R1 que abalou os mercados globais de IA no início de 2025.

Liang Wenfeng é um empreendedor chinês e fundador da DeepSeek, um laboratório de pesquisa em IA que atraiu atenção internacional no início de 2025 após lançar um modelo de raciocínio que igualou os principais sistemas ocidentais a uma fração do custo de treinamento relatado.

Liang formou-se em engenharia eletrônica e de informação e engenharia de informação e comunicação na China antes de cofundar a High-Flyer, um fundo de hedge quantitativo que usava técnicas de aprendizado de máquina para negociação automatizada. O investimento inicial da High-Flyer em infraestrutura de GPU para seus modelos de negociação deu à equipe de Liang recursos computacionais internos e talento de engenharia excepcionalmente fortes, que ele redirecionou para a pesquisa geral em IA ao fundar a DeepSeek em 2023 como um esforço derivado financiado pelo fundo.

DeepSeek-R1 e o choque no mercado

A DeepSeek lançou uma série de modelos de linguagem de grande escala de pesos abertos ao longo de 2023 e 2024, mas o perfil da empresa mudou drasticamente em janeiro de 2025 com o lançamento do DeepSeek-R1, um modelo de raciocínio treinado com aprendizado por reforço em larga escala que teve desempenho competitivo com o o1 da OpenAI em benchmarks de matemática e codificação. A DeepSeek publicou um relatório técnico descrevendo um custo de treinamento muito inferior às estimativas da indústria para modelos de fronteira comparáveis e liberou os pesos do modelo abertamente, permitindo que desenvolvedores de todo o mundo o baixassem e executassem. O anúncio desencadeou o choque da DeepSeek, uma forte liquidação em ações relacionadas à IA, incluindo a NVIDIA, enquanto investidores questionavam suposições sobre quanto gasto em infraestrutura de computação o progresso da IA de fronteira realmente exigia.

Abordagem técnica

Os modelos da DeepSeek sob Liang fizeram uso extensivo de arquiteturas mistura de especialistas e técnicas de treinamento focadas em eficiência para reduzir custos computacionais, e a empresa publicou artigos técnicos excepcionalmente detalhados em comparação com laboratórios ocidentais, que cada vez mais divulgavam menos sobre seus métodos de treinamento à medida que a competição se intensificava. Liang deu poucas entrevistas públicas, mas nas que concedeu descreveu a missão da DeepSeek como buscar capacidade geral de IA por si só, em vez de produtos comerciais de curto prazo.

Recepção

O baixo perfil público de Liang, em contraste com a proeminência dos executivos ocidentais de IA, atraiu considerável curiosidade da mídia após o lançamento do DeepSeek-R1, e a mídia estatal chinesa e autoridades destacaram a empresa como evidência da capacidade de IA da China apesar dos controles de exportação dos EUA sobre chips avançados. Comentaristas ocidentais debateram se os custos de treinamento relatados pela DeepSeek eram totalmente representativos do investimento total, enquanto concordavam amplamente que o lançamento havia acelerado o interesse em técnicas eficientes de treinamento e inferência em toda a indústria.

Categorias:ai-industry·reasoning-models·china-ai
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico