Briefing da ObenanBriefing principal

Entrar na lista não é o mesmo que ser escolhido

Menção, primeiro lugar e dados corretos são problemas distintos. Um estudo de sete dias em dois submercados de Bali ajuda a medi-los, sem receita de ranking.

Em uma frase

Problemas diferentes pedem soluções diferentes, e uma resposta isolada não revela qual deles você enfrenta. Ela é uma única amostra de um sistema, uma pergunta, um lugar, um idioma e um momento.

Leia as fontes

As evidências

85,6%pelo menos

desses estabelecimentos nunca foram recomendados por nenhum dos quatro sistemas.

FonteArtigo completo em HTML no arXivArtigo completo no arXiv, resultados. Consultado em 30 de agosto de 2026 e novamente em 2 de setembro de 2026.

Publicado
5 de setembro de 2026
Formato
Briefing principal
Fontes
2 fontes primárias e públicas
Base das evidências
Pré-publicação observacional pré-registrada, em dois submercados de Bali

Em dois submercados de Bali, a maioria dos estabelecimentos nunca foi mencionada por nenhum dos quatro sistemas de IA estudados. Algumas respostas ainda indicavam negócios que já tinham fechado. São problemas distintos, e nenhum se resolve com um truque de posicionamento.

01A cena

Ficar de fora de uma resposta não deixa sinal

Cena hipotéticaUma situação imaginada para explicar como isso funciona. Não descreve uma empresa, um cliente ou uma resposta real.

Imagine um visitante a duas ruas de distância, decidindo onde comer. Em vez de percorrer um mapa, ele pergunta a um assistente de IA e lê uma resposta curta com quatro lugares. Se o seu estabelecimento não estiver entre eles, não acontece nada que você consiga ver: nenhum clique perdido, nenhuma reserva abandonada, nenhuma reclamação. A cena é hipotética, mas a mudança por trás dela pode ser medida. Uma resposta é uma lista curta, com espaço para poucos nomes. Quando um estabelecimento fica de fora, seu gestor não recebe nenhum sinal.

02As evidências

Três falhas podem se esconder em uma resposta curta

Se seu estabelecimento não aparece na resposta, ou aparece com informações erradas, pelo menos três coisas diferentes podem ter falhado:

  • 01

    Entrada

    O estabelecimento chegou a ser mencionado?

  • 02

    Posição

    Se foi mencionado, em que lugar apareceu entre os outros nomes?

  • 03

    Atualidade

    As informações associadas a ele ainda eram verdadeiras?

Problemas diferentes pedem soluções diferentes, e uma resposta isolada não revela qual deles você enfrenta. Ela é uma única amostra de um sistema, uma pergunta, um lugar, um idioma e um momento.

03As evidências

A maioria dos estabelecimentos nunca foi mencionada

Uma pré-publicação pública reuniu uma lista completa de 4.776 cafés, restaurantes e bares na região ampliada de Canggu e em Ubud, dois submercados de Bali. Depois, perguntou a quatro sistemas de IA onde comer e beber nesses locais. Dentro desse mercado e desse método de medição, pelo menos 85,6% dos 4.776 estabelecimentos nunca foram recomendados por nenhum dos quatro sistemas. Entre os estabelecimentos com pelo menos 50 avaliações, a parcela nunca recomendada foi de 72,6%.

Os dois números descrevem esse cadastro, nesses dois submercados, em inglês, por meio das interfaces apoiadas em busca desses quatro sistemas. Não são uma referência para outra cidade, idioma, categoria ou aplicativo.

A maioria dos estabelecimentos nunca foi mencionada

cafés, restaurantes e bares no cadastro da região ampliada de Canggu e em Ubud.
4.776
desses estabelecimentos nunca foram recomendados por nenhum dos quatro sistemas.
85,6%pelo menos
nunca foram recomendados, entre os estabelecimentos com pelo menos 50 avaliações.
72,6%

Este cadastro, estes dois submercados, perguntas em inglês, quatro sistemas acessados por interfaces apoiadas em busca e uma janela de sete dias. Não é uma referência para outra cidade, idioma, categoria ou aplicativo.

FonteArtigo completo em HTML no arXivArtigo completo no arXiv, resultados. Consultado em 30 de agosto de 2026 e novamente em 2 de setembro de 2026.

04As evidências

Ser mencionado e chegar ao topo não são a mesma coisa

Neste estudo, o que esteve associado à entrada em uma resposta foi a documentação do negócio: site próprio, volume de avaliações, preço informado e menções em outros lugares da web. A nota em estrelas não apresentou associação nessa primeira etapa. Entre os estabelecimentos que já apareciam em uma resposta, a nota esteve associada à primeira posição, e o volume de avaliações também continuou relevante.

A leitura precisa ser restrita: entrada e posição se comportaram como resultados diferentes e precisam ser medidas separadamente. Nenhuma dessas associações demonstra que alterar um campo cause uma recomendação.

Entrar na resposta e chegar ao primeiro lugar tiveram associações diferentes

Razões de chances do modelo estatístico ajustado. Acima de 1 significa maior chance dentro desse modelo. Associação, não causa. Entre os estabelecimentos já mencionados em uma resposta, a nota teve associação com a primeira posição, e o volume de avaliações também continuou a importar nessa etapa.

Ser mencionado em uma resposta

  • Site próprio1,92
  • Volume de avaliações1,64
  • Preço informado1,54
  • Menções em sites de terceiros1,44
  • Nota em estrelasinterpretada como associação nula nesta etapa0,89

Primeira posição, entre os estabelecimentos já mencionados

  • Nota em estrelas1,17

1,0 significa ausência de associação

FonteArtigo completo em HTML no arXivArtigo completo no arXiv, modelos de entrada e de posição. O autor interpreta a nota em 0,89 como associação nula para a entrada. Consultado em 2 de setembro de 2026.

05As evidências

Informações desatualizadas apareceram mais que informações inventadas

Entre 12.439 menções válidas a estabelecimentos, os sistemas recomendaram locais permanentemente fechados 93 vezes, envolvendo 14 estabelecimentos com fechamento confirmado. Separadamente, após a verificação, um nome continuou classificado como provavelmente inventado. Ele apareceu em 10 menções, ou 0,08% das menções válidas.

O autor interpreta esse contraste como um sinal de que, nessa coleta, a falha prática está na desatualização, mais do que na invenção. É preciso ler com cuidado: trata-se da comparação entre duas contagens dentro de uma janela de sete dias, não de uma classificação dos danos. As duas contagens são pequenas, e nenhuma teve acompanhamento posterior. O estudo observou o que os sistemas disseram, não o que alguém fez depois. Portanto, não mostra quanto cada tipo de erro custa a um negócio.

A implicação é limitada. Manter horários, endereço, preços, disponibilidade e situação de funcionamento corretos tem valor por si só. Este estudo não mostra que corrigir esses dados faça um estabelecimento entrar em uma resposta, subir para o primeiro lugar ou atrair alguém até a porta.

Dados desatualizados e nomes inventados

menções válidas a estabelecimentos em 2.208 execuções na etapa confirmatória

12.439

93

menções a estabelecimentos fechados permanentemente14 estabelecimentos confirmados como fechados

10

menções a um nome de estabelecimento considerado provavelmente inventado0,08% das menções válidas

Uma comparação de duas contagens em uma janela de sete dias, não uma classificação de danos. Nenhuma das contagens teve acompanhamento posterior, portanto o estudo não pode mostrar quanto cada tipo de erro custa a uma empresa.

FonteArtigo completo em HTML no arXivArtigo completo no arXiv, validação e análise de erros. Consultado em 2 de setembro de 2026.

06O limite

O que essas evidências não resolvem

O estudo é observacional. Não permite estabelecer que um site, a quantidade de avaliações, um campo de preço, uma nota ou uma correção de dados causem entrada ou posição. Abrange dois submercados de Bali, não Bali inteira nem outro mercado. Usa apenas perguntas em inglês e quatro sistemas configurados, acessados por interfaces apoiadas em busca, não pelos aplicativos que as pessoas abrem no dia a dia, durante uma única coleta de sete dias. Uma recomendação também não é uma visita, reserva, pedido ou cliente que paga. Nada aqui mede se alguém entrou no estabelecimento.

07O que fazer

O que o gestor pode fazer a seguir

  1. 01Meça entrada, posição e atualidade separadamente. Um índice único de visibilidade esconde qual delas mudou.
  2. 02Registre como a medição foi feita: sistema, interface, configuração, pergunta, idioma, lugar, data, resposta e ordem dos nomes.
  3. 03Repita antes de concluir. Use mais de uma execução, formulação e sistema, e trate amostras pequenas como retratos pontuais.
  4. 04Mantenha as informações públicas atualizadas porque os clientes as usam, não porque este estudo demonstre que elas melhoram o posicionamento.
  5. 05Comprove os resultados com clientes por outros meios. Aparecer em uma resposta não é prova de venda.

08Mais detalhes

As evidências por trás disso, em mais detalhe

O artigo é uma pré-publicação pública, ainda sem revisão por pares. Sua etapa confirmatória incluiu 2.208 execuções ao longo de sete dias e produziu 12.439 menções válidas a estabelecimentos. Foram usadas 96 perguntas em inglês adaptadas a perfis de usuário, enviadas ao ChatGPT, Claude, Gemini e Perplexity por meio de APIs apoiadas em busca, não pelos aplicativos para consumidores. O desenho do estudo, as hipóteses e o plano de análise foram pré-registrados publicamente antes da coleta confirmatória. Isso facilita distinguir testes planejados de explicações escolhidas depois de conhecer os resultados.

As associações com a entrada são apresentadas como razões de chances de um modelo estatístico ajustado: volume de avaliações, 1,64; site próprio, 1,92; preço informado, 1,54; menções em sites de terceiros, 1,44; e nota, 0,89, que o autor interpreta como uma associação nula nessa etapa. Dentro das respostas, a nota esteve associada à primeira posição com razão de chances de 1,17. Uma razão de chances acima de 1 significa chances maiores dentro daquele modelo. Não é um ganho em pontos percentuais nem uma evidência de causa.

A repetibilidade também foi medida, e é fácil interpretar mal os números. Fazer a mesma pergunta novamente ao mesmo sistema devolveu um conjunto de estabelecimentos substancialmente diferente: a similaridade média de Jaccard entre execuções repetidas foi de 0,22 para o Claude a 0,45 para o Gemini. Essa medida é a parcela de estabelecimentos que duas listas têm em comum em relação a todos os estabelecimentos mencionados em qualquer uma delas. Assim, 1 significa listas idênticas, e 0 significa que não têm nenhum nome em comum. Uma média de 0,30 indica, portanto, que o par típico de execuções compartilhou cerca de um terço dos nomes envolvidos. Não significa que a mesma resposta voltou em 30% das vezes. Medida da mesma forma, a sobreposição entre os 20 primeiros estabelecimentos de sistemas diferentes foi de 0,33 a 0,54. Uma nova medição duas semanas depois apresentou uma troca de nomes comparável à das repetições dentro do período original. O autor atribui isso à variação da amostragem, não a uma mudança ao longo do tempo.

O método de medição também tinha limitações. O número de repetições variava por sistema: Perplexity, 10 vezes por pergunta; ChatGPT e Gemini, 5; e Claude, 3. O caminho usado pelo Claude foi limitado a duas buscas por execução. Após as correções, a validade segundo os critérios estritos por execução foi de 91,5%, e a correspondência entre nomes e estabelecimentos teve precisão de aproximadamente 98% a 99%, sem chegar à perfeição.

A Norly financiou e realizou o estudo e vende ferramentas de gestão de avaliações e visibilidade em IA para negócios de hospitalidade. O autor declara esse interesse comercial e descreve as medidas de pré-registro e validação destinadas a proteger a pesquisa dessa influência. Essas medidas não eliminam o conflito comercial. A Obenan atua na mesma categoria. Por isso, essas evidências, incluindo a nossa interpretação, merecem o mesmo cuidado.

Ilustração, não resultados do estudoComo a repetibilidade foi medida

Primeira execução

Segunda execução

Mencionado nas duas execuções
Mencionado em apenas uma execução

2 / 6= 0.33

Mesmo sistema, mesma pergunta, feita novamentesimilaridade média de Jaccard, de Claude a Gemini
0,22 a 0,45
Os 20 primeiros estabelecimentos em sistemas diferentesmedidos da mesma forma
0,33 a 0,54

FonteArtigo completo em HTML no arXivArtigo completo no arXiv, resultados de repetibilidade. Consultado em 2 de setembro de 2026.

A similaridade de Jaccard é a parcela de estabelecimentos em comum nas duas listas, considerando todos os estabelecimentos mencionados em qualquer uma delas. Dois nomes em comum entre seis mencionados dão 0,33. Não é a parcela de execuções que retornaram a mesma resposta.

09Fontes

Fontes

Apenas fontes primárias e públicas. As datas de publicação e as datas em que consultamos cada fonte ficam separadas para que a cronologia possa ser conferida.

  1. 01Resumo e registro de submissão no arXiv, submetido em 7 de agosto de 2026; consultado em 30 de agosto de 2026.
  2. 02Artigo completo em HTML no arXiv, métodos, pré-registro, resultados, validação, limitações, financiamento e declaração de interesse concorrente; consultado em 30 de agosto de 2026 e novamente em 2 de setembro de 2026.