Briefing da ObenanBriefing de referência
Entrar na lista não é o mesmo que ser escolhido
Entrar numa resposta de IA, surgir primeiro e estar bem descrito são três problemas. Um estudo de sete dias em dois submercados de Bali mede-os, sem receitas.
Numa frase
Problemas diferentes exigem correções diferentes, e uma resposta isolada não permite saber qual deles está em causa. É apenas uma amostra de um sistema, uma pergunta, um lugar, uma língua e um momento.
A evidência
85,6%pelo menos
destes estabelecimentos nunca foram recomendados por nenhum dos quatro sistemas.
FonteArtigo integral em HTML no arXivArtigo completo no arXiv, resultados. Consultado em 30 de agosto de 2026 e novamente em 2 de setembro de 2026.
- Publicado
- 5 de setembro de 2026
- Formato
- Briefing de referência
- Fontes
- 2 fontes primárias e públicas
- Base da evidência
- Pré-publicação observacional pré-registada, em dois submercados de Bali
Em dois submercados de Bali, a maioria dos estabelecimentos nunca foi referida por nenhum dos quatro sistemas de IA estudados. Algumas respostas continuavam a indicar negócios já encerrados. São problemas diferentes, e nenhum se resolve com um truque de posicionamento.
01A cena
Ficar fora de uma resposta não deixa rasto
Cena hipotéticaUma situação imaginada para explicar o funcionamento. Não descreve nenhuma empresa, cliente ou resposta real.
Imagine um visitante a duas ruas de distância, a decidir onde comer. Em vez de percorrer um mapa, pergunta a um assistente de IA e lê uma resposta curta com quatro lugares. Se o seu estabelecimento não estiver entre eles, nada acontece que consiga observar: não há um clique perdido, uma reserva abandonada ou uma reclamação. A cena é hipotética, mas a mudança que a sustenta pode ser medida. Uma resposta é uma lista curta, com espaço para poucos nomes. Quando um estabelecimento fica de fora, o seu responsável não recebe qualquer sinal.
02A evidência
Uma resposta curta pode esconder três falhas
Se o seu estabelecimento não aparece na resposta, ou aparece descrito de forma errada, pelo menos três coisas diferentes podem ter corrido mal:
- 01
Entrada
O estabelecimento chegou a ser referido?
- 02
Posição
Caso tenha sido referido, onde ficou entre os restantes nomes?
- 03
Atualidade
Os dados que lhe foram associados continuavam corretos?
Problemas diferentes exigem correções diferentes, e uma resposta isolada não permite saber qual deles está em causa. É apenas uma amostra de um sistema, uma pergunta, um lugar, uma língua e um momento.
03A evidência
A maioria dos estabelecimentos nunca chegou a ser referida
Uma pré-publicação pública reuniu uma lista completa de 4.776 cafés, restaurantes e bares na região alargada de Canggu e em Ubud, dois submercados de Bali. Em seguida, perguntou a quatro sistemas de IA onde comer e beber nesses locais. Dentro desse mercado e desse instrumento de medição, pelo menos 85,6% dos 4.776 estabelecimentos nunca foram recomendados por nenhum dos quatro sistemas. Entre os estabelecimentos com pelo menos 50 avaliações, a proporção nunca recomendada foi de 72,6%.
Ambos os valores descrevem este registo, nestes dois submercados, em inglês, através das interfaces apoiadas em pesquisa destes quatro sistemas. Não constituem uma referência para outra cidade, língua, categoria ou aplicação.
A maioria dos estabelecimentos nunca foi referida
- cafés, restaurantes e bares no registo da região alargada de Canggu e em Ubud.
- 4.776
- destes estabelecimentos nunca foram recomendados por nenhum dos quatro sistemas.
- 85,6%pelo menos
- nunca foram recomendados, entre os estabelecimentos com pelo menos 50 avaliações.
- 72,6%
Este registo, estes dois submercados, perguntas em inglês, quatro sistemas acedidos através de interfaces cujas respostas se apoiavam em pesquisas e uma janela de sete dias. Não serve de referência para outra cidade, língua, categoria ou aplicação.
FonteArtigo integral em HTML no arXivArtigo completo no arXiv, resultados. Consultado em 30 de agosto de 2026 e novamente em 2 de setembro de 2026.
04A evidência
Ser referido e chegar ao primeiro lugar não são a mesma coisa
Neste estudo, a entrada numa resposta esteve associada à documentação: site próprio, volume de avaliações, preço indicado e menções noutros pontos da web. A classificação por estrelas não mostrou associação nessa primeira fase. Entre os estabelecimentos que já tinham entrado numa resposta, a classificação esteve associada à primeira posição, e o volume de avaliações continuou a contar também nessa fase.
A conclusão deve ser restrita: entrada e posição comportaram-se como resultados distintos e precisam de ser medidas separadamente. Nenhuma destas associações mostra que alterar um campo provoque uma recomendação.
Entrar na resposta e alcançar o primeiro lugar tiveram associações diferentes
Razões de chances do modelo estatístico ajustado. Acima de 1 significa maior chance dentro desse modelo. Associação, não causa. Entre os estabelecimentos já referidos numa resposta, a classificação esteve associada à primeira posição, e o volume de avaliações continuou a ter importância nessa fase.
Ser referido numa resposta
- Site próprio1,92
- Volume de avaliações1,64
- Preço indicado1,54
- Menções em sites de terceiros1,44
- Classificação por estrelasinterpretada como associação nula nesta fase0,89
Primeira posição, entre os estabelecimentos já referidos
- Classificação por estrelas1,17
1,0 significa ausência de associação
FonteArtigo integral em HTML no arXivArtigo completo no arXiv, modelos de entrada e de posição. O autor interpreta a classificação de 0,89 como associação nula para a entrada. Consultado em 2 de setembro de 2026.
05A evidência
Dados desatualizados surgiram mais vezes do que dados inventados
Em 12.439 menções válidas a estabelecimentos, os sistemas recomendaram locais definitivamente encerrados 93 vezes, envolvendo 14 estabelecimentos cujo encerramento foi confirmado. Separadamente, após verificação, um nome manteve-se classificado como provavelmente inventado. Surgiu em 10 menções, ou 0,08% das menções válidas.
O autor interpreta este contraste como indicação de que, nesta recolha, a falha prática é a desatualização, mais do que a invenção. A leitura exige cuidado: é uma comparação de duas contagens numa janela de sete dias, não uma ordenação dos danos. Ambas as contagens são pequenas e nenhuma foi acompanhada para lá desse ponto. O estudo observou o que os sistemas disseram, não o que alguém fez a seguir. Não permite, por isso, mostrar quanto custa cada tipo de erro a um negócio.
A implicação é limitada. Manter horários, morada, preços, disponibilidade e estado de funcionamento corretos tem valor por si. O estudo não mostra que corrigir esses dados faça um estabelecimento entrar numa resposta, subir ao primeiro lugar ou levar alguém até à porta.
Dados desatualizados e nomes inventados
menções válidas a estabelecimentos em 2.208 execuções na fase confirmatória
12.439
93
menções a estabelecimentos encerrados permanentemente14 estabelecimentos confirmados como encerrados
10
menções a um nome de estabelecimento considerado provavelmente inventado0,08% das menções válidas
Uma comparação de duas contagens numa janela de sete dias, não uma classificação de danos. Nenhuma das contagens teve acompanhamento posterior, pelo que o estudo não permite saber quanto custa a uma empresa cada tipo de erro.
FonteArtigo integral em HTML no arXivArtigo completo no arXiv, validação e análise de erros. Consultado em 2 de setembro de 2026.
06O limite
O que esta evidência deixa em aberto
O estudo é observacional. Não pode estabelecer que um site, uma contagem de avaliações, um campo de preço, uma classificação ou uma correção factual provoquem entrada ou posição. Abrange dois submercados de Bali, não Bali no seu todo nem outro mercado. Utiliza apenas perguntas em inglês e quatro sistemas configurados, acedidos por interfaces apoiadas em pesquisa, não pelas aplicações que as pessoas abrem, durante um único período de recolha de sete dias. Uma recomendação também não é uma visita, uma reserva, uma encomenda ou um cliente pagante. Nada aqui mede se alguém entrou no estabelecimento.
07O que fazer
O que o responsável pode fazer a seguir
- 01Meça entrada, posição e atualidade em separado. Um único índice de visibilidade esconde qual delas mudou.
- 02Registe o instrumento de medição: sistema, interface, configuração, pergunta, língua, lugar, data, resposta e ordem dos nomes.
- 03Repita antes de concluir. Use mais de uma execução, formulação e sistema, e trate amostras pequenas como retratos pontuais.
- 04Mantenha os dados públicos atualizados porque os clientes os utilizam, não porque esta evidência os transforme numa forma de melhorar a posição.
- 05Comprove os resultados com clientes noutros sistemas. Aparecer numa resposta não é prova de venda.
08Em mais pormenor
A evidência em que isto assenta, com mais detalhe
O artigo é uma pré-publicação pública e ainda não foi revisto por pares. A sua fase confirmatória abrangeu 2.208 execuções ao longo de sete dias e produziu 12.439 menções válidas a estabelecimentos. Utilizou 96 perguntas em inglês adaptadas a perfis de utilizador, colocadas ao ChatGPT, Claude, Gemini e Perplexity através de APIs apoiadas em pesquisa, não das suas aplicações para consumidores. O desenho, as hipóteses e o plano de análise foram pré-registados publicamente antes da recolha dos dados confirmatórios. Isto ajuda a distinguir os testes planeados das explicações escolhidas depois de conhecidos os resultados.
As associações com a entrada são apresentadas como razões de chances de um modelo estatístico ajustado: volume de avaliações, 1,64; site próprio, 1,92; preço indicado, 1,54; menções na web por terceiros, 1,44; e classificação, 0,89, que o autor interpreta como uma associação nula nessa fase. Dentro das respostas, a classificação esteve associada à primeira posição com uma razão de chances de 1,17. Uma razão de chances superior a 1 significa chances maiores dentro desse modelo. Não é um ganho em pontos percentuais nem uma prova de causalidade.
Também foi medida a repetibilidade, e é fácil ler mal estes números. Colocar novamente a mesma pergunta ao mesmo sistema devolveu um conjunto substancialmente diferente de estabelecimentos: a semelhança média de Jaccard entre execuções repetidas variou de 0,22 no Claude a 0,45 no Gemini. Esta medida é a proporção de estabelecimentos comuns às duas listas em relação a todos os estabelecimentos que qualquer uma delas menciona. Assim, 1 significa que as listas são idênticas e 0 que não têm nenhum nome em comum. Uma média de 0,30 diz, portanto, que o par típico de execuções partilhou cerca de um terço dos nomes envolvidos. Não significa que a mesma resposta tenha voltado em 30% das vezes. Medida da mesma forma, a sobreposição entre os primeiros 20 estabelecimentos de sistemas diferentes variou de 0,33 a 0,54. Uma nova medição duas semanas depois produziu uma mudança de nomes comparável à das repetições dentro do período original. O autor atribui-a à variação da amostragem, não a uma alteração ao longo do tempo.
O instrumento tinha as suas próprias limitações. O número de repetições diferia por sistema: Perplexity, 10 vezes por pergunta; ChatGPT e Gemini, 5; e Claude, 3. O percurso usado pelo Claude estava limitado a duas pesquisas por execução. Após correções, a validade segundo os critérios estritos por execução foi de 91,5%, e a correspondência entre nomes e estabelecimentos teve uma exatidão aproximada de 98% a 99%, sem ser perfeita.
A Norly financiou e realizou o estudo e vende ferramentas de gestão de avaliações e visibilidade em IA a negócios de hotelaria e restauração. O autor declara esse interesse comercial e descreve as medidas de pré-registo e validação destinadas a proteger o trabalho dessa influência. Essas medidas não eliminam o conflito comercial. A Obenan atua na mesma categoria. Esta evidência, incluindo a nossa leitura, merece por isso o mesmo cuidado.
Primeira execução
Segunda execução
- Referido em ambas as execuções
- Referido apenas numa execução
2 / 6= 0.33
- Mesmo sistema, mesma pergunta, repetidasemelhança média de Jaccard, de Claude a Gemini
- 0,22 a 0,45
- Os 20 primeiros estabelecimentos em sistemas diferentesmedidos da mesma forma
- 0,33 a 0,54
FonteArtigo integral em HTML no arXivArtigo completo no arXiv, resultados de repetibilidade. Consultado em 2 de setembro de 2026.
09Fontes
Fontes
Apenas fontes primárias e públicas. Mantemos separadas as datas de publicação e as datas em que consultámos cada fonte, para permitir a verificação da cronologia.
- 01Resumo e registo de submissão no arXiv, submetido em 7 de agosto de 2026; consultado em 30 de agosto de 2026.
- 02Artigo integral em HTML no arXiv, métodos, pré-registo, resultados, validação, limitações, financiamento e declaração de interesses concorrentes; consultado em 30 de agosto de 2026 e novamente em 2 de setembro de 2026.