Skip to main content
Open navigation menu
Close suggestions
Search
Search
en
Change Language, English
Upload
Sign in
Sign in
0 ratings
0% found this document useful (0 votes)
6 views
34 pages
Learning
MACHINE LEARNING
Uploaded by
Sabrina Lameiras
AI-enhanced title
Copyright
© All Rights Reserved
We take content rights seriously. If you suspect this is your content,
claim it here
.
Available Formats
Download as PDF or read online on Scribd
Download
Save
Save -learning For Later
Share
0%
0% found this document useful, Mark this document as useful
0%
0% found this document not useful, Mark this document as not useful
Print
Embed
Report
0 ratings
0% found this document useful (0 votes)
6 views
34 pages
Learning
MACHINE LEARNING
Uploaded by
Sabrina Lameiras
AI-enhanced title
Copyright
© All Rights Reserved
We take content rights seriously. If you suspect this is your content,
claim it here
.
Available Formats
Download as PDF or read online on Scribd
Go to previous items
Download
Save
Save -learning For Later
Share
0%
0% found this document useful, Mark this document as useful
0%
0% found this document not useful, Mark this document as not useful
Print
Embed
Report
Go to next items
Download
O'REILLY srlowrnaitinin — coneeapani Apa fs Capitulo 10. Arquitetura de engenharia de TA e feedback do usuario _6 agora este lvrocobr fundagio a aplicacdes especificas. Pste capitulo discutiré como reunir essas téenl- cas para construlr produtos bem-sucedidos. sma ampla gama de téenicas para adaptar modelos de was de engenharia de 1A disponivels, dor. Para simplificar esse processo, este capitulo adota uma abordagem gradual. Ele comega com a arquitetura mais simples para um aplicative de modelo de base, destaca os desafios dessa arquite- ‘ura e gradualmente adiciona componentes para abordé-los. selecionar as corretas pode parecer esma Podemos passa a eternidade raciocinando sobre como construir um aplicative pre foi inestimavel para orientar o desenvolvimento de produtos. mas para apli- cativos de 1A, 0 feedback do ususrio tem um papel ainda mals crucial como uma fonte de dados para melhorar modelos, A interface de conversagdo torna mals fi- cil para os usuarios darem feedback, mas mais dificil para os desenvolvedores ex: ‘rair sinais. Este capitula discutiré diferentes tipos de feedback de 1A de conversa- «0 como projetar um sistema para coletar o feedback certo sem prejudlicar a cexperiéncia do usuério. Arquitetura de Engenharia de IA ‘Uma arquitetura de 1A completa pode ser complexa. Esta sego segue a processo que uma equipe pode seguir na produgéo, comecando com a arquitetura mais, simples ead wentes. Apesar da diversi ando progressivamente mais iene teeecbeenete a. wf ampla gama de aplicagbes, mas certas aplicagdes podem divergir. Em sua forma mais simples, seu aplicativo recebe uma consulta e a envia para o ‘modelo. 0 modelo gera uma resposta, que é retornada ao usuério, conforme mos- trado na Figura 10-1. Nao ha aumento de contexto, nem guardrails, nem otimiza- ‘fo. A caixa Model APY se refere a APIs de terceiros (por exemplo, OpenAl, Google. Anthropie) e modelos auto-hospedados. A construcao de um servidor de inferén- cia para modelos auto-hospedados ¢ discutida no Capitulo 9 Query ‘angeanetemmmenartetetnn. fi Response ‘pie 1O1 A aguas par excuar m apnave deLA. A partir dessa arquitetura simples, vocé pode adicionar mais componentes con forme as necessidades surgirem. O processo pode parecer seguinte:1. Melhore a entrada de contexto em um modelo dando ao modelo acesso a fontes de dados externas ferramentas para coleta de informagées. 2, Coloque protesdes para proteger seu sistema e seus usuarios. 3, Adicione um roteador e gateway de modelo para dar suporte a pipelines com- plexose adicionar mais seguranga. 4. Olimize a laténciae os custos com cache. 5. Adielone logica complexa e escreva agies para maximizar os recursos do seu ‘ehnewtmrenecteoens. = tanto, as nevessidades de cada um sto diferentes. Vooé deve seguir a ordem que {az mais sentido para sua aplicagio, Monitoramento e observabilidade, que precisam ser integrais a qualquer aplica- ‘io para controle de qualidade e melhoria de desempenho, serdo discutidos no fi. nal deste processo. Orquestragdo, encadeando todos esses componentes juntos, serd discutdo depois disso. Etapa 1. Melhore o contexto ‘A expansio inical de uma plataforma geralmente envolve adicionar mecanismos para permitir que o sistema construa 0 contesto relevante necessério para o mo: elo responder a cada consulta. Conforme discutido no Capitulo 6,0 contexto pode ser construide por meio de varios mecanismos de recuperagao, incluindo re- tne mn «tens Stmtan ‘ehanneemetraete ints. ‘modelo retina informagdes automaticamente por meio de APIs, como pesquisa na ‘web, noticias, lima, eventos, et. A construgdo de contexto é como engenharia de recursos para modelos de funda- oF fornece aa modelo as informagdes necessérias para produzir uma saida Devido ao seu papel central na qualidade de saida de um sistema, a construcdo de contexto & quase universalmente suportada por provedores de API de modelo. Por exemplo, provedores como OpenAl, Claude e Gemin! permitem que os usus- ros carreguem arquivos e permitam que seus modelos usem ferramentas. ‘No entanto, assim como os modelos dferem em suas capacidades, esses provedo- res diferem em seu suporte a construglo de contexto, Por exemple, eles podem {er limitagdes sobre quais tipos de documentos e quantos vocé pode carregar. ‘Uma solugio RAG especializada pode permitir que voet carregue tantos docu “hammers, 563 documentos. Diferentes estruturas também diferem em seus algoritmos de recu- peragio e outras configuragies de recuperaglo, como tamanhos de bloco. Da ‘mesma forma, para uso de ferramentas, as solugdes também diferem nos tipos de ferramentas que suportam e nos modos de execucZo, como se suportam execuco 4e fungao paralela ou trabathos de longa duragao. Com a construcio do contexto, a arquitetura agora se parece com a Figura 10-2. ‘anne esmmmrnsetenann. 8)on Tig 08 Un argu de nator com oro ge oe Etapa 2. Coloque os guarda-corpos CGuardralls ajudam a mitigar riscos proteger voet e seus usuarios. Fes devern ser colocados sempre que houver exposigdes a riscos. Em geral, eles podem ser ca- {egorizados em guardrails em torno de entradas esaidas. Guarda-corpos de entrada 0s guardrails de entrada geralmente protegem contra dois ipos de riscos:vaza- ‘mento de informacoes privadas para APIs externas e execusao de promps ruins ue comprometem seu sistema, 0 Capitulo discute muitas maneiras diferentes ‘chenatemeernceneonnnns. ED scos, os riscos nunca podem ser totalmente eliminados, devido & natureza ine rente de como os modelos geram respostase falhas humanas inevitaveis. Vazar formagbes privadas para APIs externas é um rico especifico do uso de ADIs de modelo externo quando voc® precisa enviar seus dados para fora da sua corganlzagdo. Iso pode acontecer por varios motivos, incluindo os seguintes: + Um funcionario copia o segredo da empresa ou as informagbes privadas de um usuario em um prompt eas envia para uma API de terceiros.* + Um desenvolvedor de aplicativoseoloca as politcas e dados internos da em- presa no prompt do sistema do aplicativo, + Uma ferramenta recupera informacoes privadas de um banco de dados interno eas adiciona ao context. tne pn ‘aaeemeoammmmnatsonaens. if sus as muss serLauuenas wioporuvers que uevedtai Uauvs LnLenas Auer ‘maticamente, Quais dados confidenciais detectar so especificados por voc®. As classes comuns de dados confidencinis sto as seguintes + tnformagies pessoais (nimeros de identiicagdo, niimeros de telefone, contas bancarias) + Rostos humanos + Palavras-chave e frases especticas assocladas a propriedade intelectual ou in- formagoes privilegiadas da empresa ‘Muitasferramentas de detecgio de dados sensiveis usam IA para identifiar infor- _magBes potencialmente sensiveis, como determinar se uma sequéncia se asseme- ha a um enderego residencial vélido. Se uma consulta for encontrada contendo informagoes sensives, vocé tem duas opgGes: bloquear a consulta inteira ou re- tne man ‘chen minmeanateontens. 26 resposta gerada contiver esse espago reservado, use um dicionério reverso PIL «que mapeie esse espaco reservado para as informagoes originais para que voce possa destascaréslo, conforme mostrado na Figura 10:3, User ess erro ict Wat da wen? ce oan ht de ead” {eps ait con popoyisusp37| egal ces her sted Reversible Pimap wy Teter cle Moon? Isl acon epee openerModel (Te too pode creansasjtar era caret response | Ut sere to ectequsy rane ned eesacoreces wont yur cde iete eeecbetetet as wf nated (RTE peer ee mecreetrant ae re ees pu ces hea "ew 18m en dc nce Semen deerme mand eps Guarda-corpos de saida ‘Um modelo pode falhar de muitas manelras diferentes. Os guardrails de saida tém duas funcionalidades prinelpais: + Detecte fathas de said, + specifique a politica para lidar com diferentes modos de falha Seeegemannee 8 ‘uma resposta vazia quando néo deveria* As falhas parecem diferentes para dife- rents aplicatvos. Aqui estéo alyumas falhas comuns nas duas categorasprnci- pals: qualidade eseguranga. As falhas de qualidade so dlscutidas no Capitulo 4, as falhas de seguranca slo dscutidas no Capitulo 5, Mencionarelrapidamente algumas dessa fthas como uma reeapitulagdo: + Quatidade + Respostas malformatadas que néo seguem o formato de saida esperado. Por exemplo, oaplicativo espera JSON, € 0 modelo gera JSON invalid, + Respostasfactualmente inconsistentesalucinadas pelo modelo. Por exemplo, vocé pede para o modelo escrever uma redagao, ¢ essa redagdo & simplesmente ruim. + Seguranca + Geralmente respostasrui + Respostas que contém informagées privadas econfidenciais. + Respostas que acfonam execuglo remota de ferramentas e codigos. + Respostas de risco de marca que desearacterizam sua empresa ou seus Lembrese doCapiuleS que, para medighes de seguranc,¢ importante rastrear ‘fo apenas as falhas de seguranca, mas também a taxa de [Link] tersistemas que so muito seguros, por exemplo, um que bloguela até mesmo s0- licitagbes legitimas interrompendo as cargas de tabalho do usuérioeeausando frustragio ao ususrio. ‘Muitasfalhas podem ser mitigadas por uma ca de repetigSo simples. Os mode los de 1A so probabilsticos, 0 que significa que se vocé tentar uma consulta no- vamente. poderé obter uma resposta diferente. Por exemplo. se a respostaestiver ‘esaenwtenmennaitemnmns. {eja formatada corretament, Essa politica de repetisfo, no entanto, pode incorrer em laténcia e custo extras. cada repeticio significa outra rodada de chamadas de API. Sea repeticio for rea- \zada apés a falha, a laténcla pereebida pelo usuério dobraré, Para reduzira la«tens Sptmitan ‘encia, voce poae lazer cnamaaas em paraiso, vor exempio, para caaa consulta, fem vez de esperar a primeira consulta falhar antes de tentar novamente, vocé en- via essa consulta ao modelo duas vezes ao mesmo tempo. recebe duas respostas € escothe & melhor. Isso aumenta 0 mimero de chamadas de API redundantes, mas smantém a laténcia gerenciavel. ‘Também é comum recorrer a humanos para solicitagbes complicadas. Por exem- plo, vocé pode transferir as consultas que contém frases especifias para operado- " 12: adel Jisada nara deci ‘tate eeprtabetetie wf) sentimentos detecta raiva nas mensagens dos usurios. Outra equipe transfere ‘uma conversa apds um certo nlmero de Voltas para evitar que os usudrios - «quem presos em um loop. Implementagao de guardrail CGuardralls vim com compensagies, Uma delas éa compensagi entre confab: dade elaté[Link] reconhesam a importancia dos guardrails algumas equi- pes me disseram que a laténcia ¢ mais importante. Elas decidiram nao implemen- ‘ar guardrails porque eles podem aumentar significativamente a laténcia de seus aplicativos.* GGuardrails de saida podem nao funcionar bem no modo de conclusso de luxe. Dornaiirin toda aresnosia é corada antes de ser mastrad i a rar para ver a resposta. A desvantagem € que ¢ dlfell avalar respostas parcias, centdo respostas inseguras podem ser transmitidas aos usuarios antes que os guar Grails do sistema possam determinar que elas devem ser bloqueadas. A quantidade de guardrails que vocé precisa implementar também depende se ‘voc’ hospeda seus modelos por conta propria ou usa APIs de terceiros. Embora vvocé possa implementar guardealls em cima de ambos, APIs de tercelros podem reduzir os guardrails que voc precisa implementar, que os provedores de API rormalmente fornecem muitos guardrails prontos para uso para voe8. Ao mesmo tempo, a auto-hospedagem significa que vacé nfo precisa enviar soliitagBes ex: ternamente, oque reduz a necessidade de muitos tipos de guardrails de entrada Considerando os muitos lugares diferentes onde um aplicativo pode falhar, os bilidade. Restrigbes podem tornar um modelo mais seguro, mas também podem {orné-lo menos wilizave para casos de uso especifios. GGuardrails também podem ser implementados por desenvolvedores de aplicat- ‘vos. Muitas téenicas so discutidas no Capitula 5 na segio Defesa contra ataques rpidos. Solugdes de guardrall que voc® pode usar imediatamenteincluem Purple ‘amada Meta, NeMo Guardrails da NVIDIA .ByRIT do Azure itros de-contetida de1A do Azure , a API Perspective e a API de moderacio de conteiido da OpenAL Devido a sobreposicio de riscos em entradas e saidas, uma solugdo de guardrail provavelmente fornecerd protegio para entradas e safdas. Alguns gateways de ‘modelo também fornecem funcionalidades de guardrail, conforme discutido na préxima segio, ‘atone inmomneete mins.que os scorers sejam tpieamente menores e mats Fapidos do que os madetos ge- nerativos. No entanto, os scorers também podem ser colocados na calxa de guar arava a | =a ono eoeorrncariag ; Etapa 3. Adicionar roteador e gateway do modelo Amedida que os aplicativos crescem para envolver mais modelos, roteadores © «gateways surgem para ajudar voc® a gerenciar a complexidade eos custos de tender a varios modelos, Roteador Em vez de usar um modelo para todas as consultas, v8 pode ter galugbes dite. rentes para diferentes tipos de consultas, Essa abordagem tem virios beneficios. Primeiro, ela permite modelos especializados, que podem potencialmente ter umt esempenho melhor do que um modelo de propésito geral para consultas espect- ficas, Por exemplo, voeé pode ter um modelo especalizado em solugso de proble- ‘escmnmtegenmecetemnnns. ‘2s, vocé pode rotear consultas mais simples para modelos mais baratos. ‘Um roteador normalmente consiste um elassficador de intengdo que prevé @ que o ususrio estétentando fazer. Com base na intengao prevista, a consulta & ro ‘ada para a solugio apropriada, Como exemplo considere diferentes intengBes relevantes para um chathot de suporte ao cliente: + Seo usuario quiserredefinir a senha, encaminhe- para a pagina de perguntas frequentes sobre como recuperar a senha. + Sea solictagdo for para corrigir um erro de cobranca, encaminhe-a para um operador humano. + Sea solicitagao for sobre soluto de um problema téenico, encaminhe-a para ‘um chatbot especializado em solugao de problemas. ‘chenategeencneonnnns. Ed ‘educadamente se recusar a responder usando uma das respostas padrdo sem des- perdigar uma chamada de APL Por exemplo, seo usuario perguntar em quem ‘oct votaria na préxima eleigdo, um chatbot pode responder com: "Como um. chathot, nd tenho a eapacidade de votar. Se voeé tiver dividas sobre nossos pro- dutos leare feliz em ajudar: ‘Um clasficador de intengio pode ajudaro sstema a detectar consultas ambiguas «pedir esclarecimentos. Por exemplo, em resposta & consulta “Congelando”, 0 sis- {ema pode perguntar: "Voce quer congelar sua conta ou esté falando sobre o lima2* ou simplesmente perguntar:“Desculpe. Voce pode elaborat2tenn pan Existem outros roteadores que podem ajudar 0 modelo a decidir o que fazer em seguida, Por exemplo, para um agente capaz de varias agbes, um roteador pode assumir a forma de um preditor de préxima ‘etanme annonces. :méria 0 modelo deve extrairinformagbes, Imagine que um usuario anexa um do- ccumento que menciona Melbourne & conversa atual. Mais tarde, o usuario per- squnta: "Qual é 0 animal mais fofo de Melbourne?” O modelo precisa decidir se deve confiar nas informagées do documento anexado ou pesquisar na Internet por essa consulta, Classificadores de intencao e preditores de préxima ago podem ser implementa dos sobre modelos de fundagio. Muitas equipes adaptam modelos de linguagem ‘menores, como GPT:2, BERT e Lama 7B, como seus classificadores de intencao. -Muitas equipes optam por treinar clasificadores ainda menores do zero, Os rote- adores devem ser répidos e baratos para que possam usar varios eles sem incor rer em laténcia e custo extras signifcativos. n anda tema entdo realiza uma acao. por exemplo, uma pesquisa na web, que traz de volta um contexto de 8,000 tokens. Vocé pode truncar 0 contexto da consulta para se austar ao modelo originalmente pretendido ou rotear a consulta para um mo: elo com um limite de contexto maior. Como o roteamento geralmente é felto por modelos, coloquel o roteamento dentro a caixa Model API na Figura 10.5. Assim como os scorers, os roteadores so ge- ralmente menores do que os modelos usados para geracio. ‘eAcenemnmmennaitemdnns. 2) ‘gra 1050 rote shila ena tar snl eal para ca coma Agrupar roteadores com outros modelos torna os modelos mals ficels de geren- iar. No entanto,é importante observar que o roteamento geralmente acontece ances da recuperagio, Por exemplo, antes da recuperagio, um roteador pode aju- dara determinar se uma consulta esté dentro do escopoe, se sim, se precisa de recuperagio,O roteamenco também pode ac cer apés a recuperagio, como de- ‘enennecinenrnatemninss. =f) de 1A muito mais comum, Porta de entrada ‘Um gateway de modelo é uma camada intermediria que permite que sua organi-Interface unificada para diferentes modelos, neluindo modelos auto-hospedados e modelos por tris de APIs comerciais. tlm gateway de modelo facilta a manutengla do seu cédigo, Seuma API de modelo mudar, vocé sé precisa atualizar 0 gateway em ver de atu liza todos os aplicativos que depenciem dessa API. A Figura 10:6 mostra uma vi- sualizagio de alto nivel de um gateway de modelo. ‘atone nanmomncete mins. tne pm mem ten» ‘igure 104 Um stay de made fanece uns inerfie wii prs raha com deren mde [Em sua forma mais simples, um gateway de modelo é um wrapper unificado. 0 exemplo de cédigo a seguir é para dar uma dela de como um gateway de modelo «tenn Spmtn eheeetemmenateonas. 5) “some inportar [Link] como genai mportar openai ef openai_nodel(dados_de_entrada, nome_do_sodelo, tokens_eax.): ‘pena. api_key = [Link]{"OPENAE_API_KEY" resposta = [Link]( rnotorenone_nodelo, pronpt=dados_de entrada, inax_tokens-naxmo_tokene d retornar {"resposta": [Link]{@).text-strip()) ef gemini nodel(dados_de_entrads, nome_do_sodelo, tokens_eix.): _genai.configure(api_key=05..environ{ "GOOGLE_API_KEY"]) tran opin ‘Shaner tememtanctetett. 808 rete» Gapp-route(" /modelo", métodose{ "POST" }) deFinicto model_gateway(): dados = request.get_json() ‘tipo_nodelo = [Link]("tipo_nodelo") none_nodelo = [Link]("nore_nodelo") dados_de_entrada = [Link]("dados_de entrada") mmax_tokens = [Link]("nax tokens") ‘se model_type *= “openai”: resultado = openai_nodel(dados_de entrada, none_do_sodt elif model_type == “gemini” resultado = genini_nodel(dados_de_entrads, none _do_sodt retornar jsonify(resultedo) oe Sine deemeteieaietetints ) ayver de dara todos que desejam acesso & API OpenAl seus tokens organizacionais, que podem ser facilmente vazados, vocés6 da s pessoas acesso an gateway de ‘modelo, eriando um panto de acesso centralizado e controlado, O gateway tam- ‘bém pode implementar controles de acest refinados,especificande qual usuario (0u aplicativo deve ter acesso a qual modelo, Adm disso, o gateway pode monito- rar limitar uso de chamadas de API, prevenindo abusos e gerenciando custos de forma eficaz ‘Um gateway de modelo também pode ser usado para implementar politicas de fallback para superar limites de taxa ou falhas de API (0 ultimo é infelizmente co ‘mumm). Quando a API primatia ndo estédisponivel, o gateway pode rotear solic .8es para modelos alternativos,tentar novamente apés uma curta espera ou lidar com falhas de outras maneiras elegantes. Iso garante que seu aplic tense ‘atom nenmomneetemns. para implementar outras funcionalidades, como balanceamento de carga, registro ce andlise. Alguns gateways até fornecem cache e guardrails. Dado que os gateways siorelativamente simples de implementar, hi muitos gateways prontos para uso. Exemplos incluem Portkey’s AL Gateway. MLflow AI Gateway, Wealthsimple's LLM Gateway. Truefoundry. Kong e Cloudfare [Em nossa arquitetura, o gateway agora substtul a caixa da API do modelo, con- forme mostrado na Bigura 10.7 wy (Ber |e" | repose ‘igus 187 Argus com ord amen aeway icone, Uma camada de abstrago similar, como um tool gateway, também pode seri para aces sar uma ampla gama de ferramentas, Nao ¢ discal neste liv, pois ainda no um pa rio comm no momento em que et text fol escrito, ‘etannnedemeteaete ites. ( cache tem sido parte integrante de aplicaivos de software para reduzi lténcia custo Muitasideias de cache de software podem ser usadas para apliativos de 1A. Técnicas de cache de inferénci, ineuindo cache KV e cache de prompt, si0 Aiseutidas no Capitulo 8, Esta sego se concentra no cache do sistema, Como 0 ca- che 6 uma tecnologia antiga com uma grande quantidade de literatura existente este livro s6o cobriré em linhas geras, Em geral, hé dois mecanismos principals de cache do sistema: cache exato e cache semantic. Cache exato(Com o cache exato, os itens em cache sio usados somente quando esses itens exa- {os si solicitados. Por exemplo, se um ususrio pede a um modelo para resurnir un nduto. o sistema verifica o cache para ver se un resumno desse prodyig tne pin ‘ahem dinmounerte mints. ( cache exato também ¢ usado para recuperagao baseada em incorporagao para cevitar pesquisa de vetor redundant, Se uma consulta de entrada ji estiver no ca- che de pesquisa de vetor, busque o resultado em cache. Se no, execute uma pes- Gquisa de vetor para essa consulta e armazene o resultado em cache 0 armazenamento em cache é especialmente atraente para consullas que envol- vem varias etapas (por exemplo, cadeia de pensamento)e/ou aches demoradas, (por exemplo, recuperacio, execusdo de SQL ou pesquisa na web). ‘Um cache exato pode ser implementado usando armazenamento na meméria para recuperacdo répida. No entanto, como o armazenamento na meméria éLiml- ‘ado, um cache também pode ser implementado usando baneos de dadas como PostgreSQL Reds ou armazenamento em camadas para equilibrar velocidade e teens pin «senna ‘ean eemmrnaetvinamn. f8) Jneluem Least Recently Used (LRU), Least Frequently Used (LEU) e frst in, frst out erro. 0 tempo para manter uma consulta no eache depende da probabilidade de essa consulta ser chamada novamente. Consultas especifcas do usuario, como "Qual é ‘status do meu pedido recente”, tém menos probabilidade de serem reutilizadas or outros usuérios , portanto, ndo dever ser armazenadas em cache. Da ‘mesma forma, faz, menos sentido armazenar em cache consultassensivels aa {ompo, como "Como esté o cima?” Multas equipes treinam um classificador para prever se uma consulta deve ser armazenada em cache. ‘cache, quando nto tratad corretamente, pode causar vazamentos de dados. Imagine sasacdsabalba sarasumsitad at nasauta ‘ehanmenenmantnnennnt. 869 cupera a informagies do usuéro Xe, em segulda era uma respostacontendo as informa bes de [Link] essa consulta com uma pergunta genérca, 0 sistema armazena a resposta em cache. Mats tarde, quando o uso Y fz mesma pergunta,o resultado em cache ¢ retornado,reveland as informagies de X para ¥. Cache semantico Diferentemente do cache exato, os tens em cache so usados mesmo que sejam apenas semanticamente semelhantes, no idénticos, a consulta recebida. Imagine ‘que um usuério pergunte: "Qual € a capital do Vietna2” e 0 modelo responda: "Ha- 1ndi. Mais tarde, outro usuério pergunte: "Qual éa capital do View" que &se- :manticamente a mesma pergunta, mas com uma formulagio ligelramente dife- rete. Com 0 cache semantico, o sistema pode reutilizar a resposta da primeira {anto,o cache semantico pode reduzir 0 desempenho do seu modelo. ( cache semantico sé funciona se voe8 tiver uma maneira conf nar se duas consultas so semelhantes, Uma abordagem comum é usar similar dade semantica, que é discutida no Capitulo 3, Como uma atualizagdo, a similar 1 de determi-cane semanuca runciona aa seguinte maneira: 1. Para cada consulta gere sua incorporasao usando um modelo de incorporagao. 2. Usea busca vetorial para encontrar o embedding em cache com a maior pont ago similar ao embedding de consulta atual. Digamos que essa pontuagao de simillaridade seja X. 3, Se X for maior que um certo limite de similaridade, a consulta em cache ser considerada similar, os resultados em cache serdo retornados. Caso contrario, processe essa consulta afual e armazene-a em cache junto com sua incorpora~ Lissa abordagem requer um banco de dads vetorial para armazenat as incorpo- rages de consultas armazenadas em cache, Comparado a outras ténleas de cache, 0 valor do cache semantico é mais duvideso Porque muitos de seus componentes sao propensos a falhas. Seu sucesso depende de embeddings de ata qualidade, busca de vetor funcional e uma métrica de simi- laridade correto laridade conflével. Definiro limite des sém pode ser com- plicado, exigindo muita tentativa e erro, Se o sistema confundir a consulta rece bida com uma semelhante a outra consulta, a resposta retornada, buscada do ca- che, estaré incorreta. ‘Alem disso, cache semantic pode ser demorado e exigit muita computacao, pois envolve uma busca vetorial A velocdade e o custo dessa busca vetoralde- pendem do tamanho dos seus embeddings em cache. Rice temecbeetete a. wf aproveitando 0s resultados armazenados em cache. No entanto, antes de incorpo- rar as complexidades de um cache semantico, cerdfiquesse de avallar 0s riscos de eficéncia, custo e desempenho associados a ele. Com os sistemas de cache adicionados, a plataforma se parece com a Figura 10-8. ‘Um cache KV e um cache de prompt sfo normalmente implementados por prove- ores de API de modelo, entio eles nfo io mostrados nesta imagem. Se eu tiver| «que visualizé-os, eu os colocaria na caixa API de modelo. Ha uma nova seta par Adicionar respostas geradas ao cache. ‘eheonatngeenceemnnns. ED own, zl] ape gu 104 un gute de pena decom cachs aon, Etapa 5. Adicionar padrées de agente enn simmnrnaetemtess. =ftne pn | tens Stmitan condicional, Os padres Agentic,diseutidos no Capitulo 6, podem ajudar voce a construir aplicaivos complexos. Por exemplo, depois que o sistema gera uma saida, ele pode determinar que no concluiu a tarefa e que precisa executar outra ‘ecuperacdo para reunir mais informagbes. A resposta original, juntamente com 0 contexto recém-recuperado,é passada para o mesmo modelo ou para um dife- rente. Isso crfa um loop, conforme mostrado na Figura 10:9. xr —~ (Feiss “ehantnmenetemns. 268 sone "ig 109. ast ations perm ou spa eu ernst. prin ‘As saidas de um modelo também podem ser usadas para invocar acdes de grava ‘40, como compor um email fazer um pedido ow inicializar uma transferéncia Dancéria, As agdes de gravacdo permitem que um sistema fara alteracbes em seu ambiente diretamente. Conforme discutido no Capitulo 6, as agbes de gravacio enenem emma. f nazumo euigauo, Com agbes ae gravagae aaeionauas, @ arquutewura se pa- rece com a Figura 10-10. «tse Stmitan rapa Figure 1010.0maarquear de aplatvo que pee quo Stems exec aps de rag Se vocé seguis todos os passos até aqui, sua arquitetura provavelmente se tornout ‘bastante complexa. Embora sistemas complexos possam resolver mais tarefas, lest nbém introduzem mais modos de falha, tornando-os mais dificeis de depu- rar devido aos muitos pontos potencials de falha. A préxima segdo abordaré as ‘melhores priticas para melhorar a observabilidade do sistema, Monitoramento e Observabilidadetne mn [Embora eu tenha colocado a observabilidade em sua prdpria seo, a observabili- aut deve ser integral ao design de um produto, em ver de algo a ser adicionado Observabilidade é uma prética universal em todas as disciplinas de engenharia de software. £ wma grande indstria com melhores praticas estabelecidas e mui tas solugdes proprietirias e de céigo aberto prontas para uso, "Para evitar rein- ventar a roda, Vou me concentrar no que ¢ exclusivo para aplicativos criados em ‘ima de modelos de fundacdo. 0 repositério GitHub do livro contém recursos ppara aqueles que querem aprender mais sobre observabilidade.* 0 objetivo da monitoramento &o mesmo que o objetivo da avaliagSo: mitigar rs: 0s e descobrir oportunidades. Riscos que o monitoramento deve ajudar a mitigar incluem fathas de aplicativos, ataques de seguranga e desvios. O monitoramento pode ajudar a descobrir oportunidades para melhoria de aplicativas e economia, de custos. 0 monitoramento também pode ajudar a mantélo responsavel, dando visibilidade ao desempenho do seu sistem. ‘atone immomncete mens. sone wetivauas ua Cunnuuusaue DEVUps: + MTTD (tempo méatio de detecsao): Quando algo ruim acontece, quanto tempo lova para ser detectado? ‘+ MTR (tempo médio de resposta): Apés a detecgfo, quanto tempo leva para ser resalvido? + CFR (change failure rate: A porcentagem de alteragdes ou implantagdes que re- sultam em falhas que exigem corresoes ou reversdes. Se vocé nao conhece sett (CPR, 6 hora de redesenar sua plataforma para torné-la mais observével. ‘Ter um CFR alto nao indica necessariamente um sistema de monitoramento rum. No entanto, vocé deve repensar seu pipeline de avaliagio para que mudangas ‘ins sejam capturadas antes de serem implantadas, Avaliagdo e monitoramento precisam trabalhar em conjunto. Métricas de avaliagao devem se traduzir bem tee Opin a eeeeemmenateonens. 8) stone» :mas detectados durante 0 monitoramento devem ser allmentados para pipeline de avaliagao. Desde meados da década de 2010, a industria comegou a adotar 0 termo “observae bilidade* em vez de “monitoramento”. O monitoramenta nao faz suposigBes sobre a relagdo entre o estado interno de um sistema e suas sidas. Vocé monitora as saidas externas do sistema para descobrir quando algo da errado dentro do sis- {ema —ndo ha garantia de que as saidas externas ajudardo voc@ a descobrir 0 que dé errado. Observabilidade, por outro lado, faz uma suposiglo mals forte do que o monitora- mento tradicional: que os estados internos de um sistema podem ser inferidos a Ueda conheckmania ds suassaidassvieenas Ouanda sluadd arid eapenntenenaitemnanns. a) seen Observabilidade é sobre instrumentar seu sistema de uma forma que garanta ue InformacGes suficientes sobre o tempo de execugHo de um sistema sejam coleta- dase analisadas para que, quando algo der errado, isso possa ajudé-loa descobrir coque dew errado,tna pman [Neste livro, usareiotermo “monitoramento” para me referir ao ato de rastrear a5 informacdes de um sistema, ¢“observabilidade” para me refer a todo 0 process de instrumentagio, rastreamento e depuragio do sistema. Métricas ‘Ao discutir monitoramento, a maioria das pessoas pensa em métricas. No entanto, as métricas em si no sfo o objetivo. Francamente, a maioria das empresas algo estéerrado e identficar oportunidades de melhoria. Antes de listar quais métricas rastrear, ¢ importante entender quais modos de fa- tha voce quer capturare projetar suas métricas em torno dessas falhas. Por exem- plo, se vocé no quer que seu aplicativo tenha alucinacbes, projete métricas que ajudem a detectar alucinagies. Uma métrica relevante pode ser sea safda de u aplicativo pode ser inferida do contesto, Se voeé nfo quer que seu aplicativo queime seu crédito de API, rastreie métricas relacionadas aos custos de API, como ‘omimero de tokens de entrada esaida por soictagio ou o custo do seu cache © a taxa de acerto do seu cache. Como os modelos de fundago podem gerar safdas abertas, hi muitas manelras pelas quais as coisas podem dat errado, O design de métricas requer pensamento Lisi, cabs sstatisticne fanusntamania criatvidada Qusisméizis ‘etonmeeanmomncete mens. [ste livra abordou muitos tipos diferentes de métricas de qualidade de modelo (Capitulos 4,5 , 8. mais adiante neste capitulo) e multas maneiras diferentes de caleulé-las (Capitulos 3 5 ). Aqui, farel uma répida recapitulagdo delas, 0s tipos mais fice de falhas para rastrear sto falhas de formato porque sto fé- ceis de notar everificar. Por exemplo, se vocé espera saidas JSON, rastreie com ue frequéncia o modelo gera JSON invalido e, entre essas sadas JSON invalidas, «quantas podem ser facilmente corrigidas(fltar um colchete de fechamento& f&- cilde corrigit, mas perder as chaves esperadas ¢ mais difeiD. ara geragies abertas,considere monitorar a eonssténcta factual e métricas de qualidade de geragio relevantes, como concisdo, eriatividade ou positividade, ‘Multas dessas métricas podem ser computadas usando juizes de 1A. ‘chcnnwtemrneateomeens. = ‘com que trequencia seus guararatis sao actonados e com que trequencia {oma se recusa a responder. Detece consultas anormais em seu sistema também, pols elas podem revelar casos de ponta interessantes ou incitarataques, ‘A qualidade do modelo também pode ser inferida por meio do feedback da in- ‘guagem natural do usuario sinais de conversacao. Por exemplo, algumas métri- cas facels que voce pode rastrear incluem o seguinte + com que frequens caminho? + Qual éo numero médlo de voltas por conversa? + Qual éo mimero médio de tokens por entrada? Os usuérios estdo usando seu usuarios interrompem uma geraglo no meto do aplicativa para tarefos mais complexas ou estfo aprendendo a ser mais conci- 508 com seus prompts? «thse Stmitan ‘ean emma intet.respostaslongas? *+ Qual € a distribuigao de tokens de saida do modelo? Como ela mudou ao longo 4o tempo? 0 modelo esta fieando mais ou menos diverso? ‘Métricas relacionadas ao comprimento também sao importantes para monitorar laténciae custos pois contextos ¢ respostas mas longos geralmente aumentam a latGneiae geram custos mais altos. cada componente em um pipeline de aplicativo tem suas propeias métricas, Por cexemplo, em um aplicativo RAG, a qualidade da recuperacio ¢ frequentemente avaliada usando relevancia de contexto e preciso de contexto, Um banco de da- os vetorial pode ser avaliado por quanto armazenamento ele precisa para inde- xar os dados e quanto tempo lova para consullar os dados. ‘eneamecimenrnateminss. =f) 4e northstar de negécios, que podem ser DAU (usuario ative didrio), duragao da sesso (0 tempo que um ustério passa ativamente engajado com o aplicativo) ou assinaturas, Métricas que sto fortemente correlacionadas com sua north star po dem Ihe dar ideias sobre como melhorar sua north star. Métricas que nko sS0 cor- relacionadas de forma alguma também podem Ihe dar ideas sobre o que ndo otimizar. O rastreamento da laténcia é essencial para entender a experiéncia do usurio, -Métricas comuns de laténcia, conforme discutido no Capitula 9, neler: + Tempo para o primeiro token (TTF: 0 tempo que leva para o primeiro token ser gerado. + Tempo por token de sada (TPOT}: 0 tempo necessario para gerar cada token de sida tna pman ‘etenmeennmomncete mins. teas pur usuario para ver Gun seu site se auapia oo’ também val querer rastrear custos. Métricas relacionadas a custoss30 0 ni mero de consultas eo volume de tokens de entrada esaida, como tokens por se sgundo (TPS). Se voc® usa uma API com limites de taxa, rastrear 0 mimero de soli- citagbes por segundo ¢ importante para garantir que voct fique dentro dos limites, alocados eevite possvelsinterrupgSes de servic. Ao caleular métricas, voce pode escolher entre verficagées pontuals veriica- Ges exaustivas, As verificagSes pontuais envolver a amostragem de um subeon- junto de dados para identiicar problemas rapidamente, enquanto as verificagBes ‘exaustivas avaliam cada solicitagdo para uma visao abrangente do desempenho. Aescolha depende dos requisitos do seu sistema e dos recursos disponiveis, com Senne Spe ‘chanewtmreeateonns. ED ‘Ao calcular métricas,garanta que las possam ser divididas por eixos relevantes. como usuarios, releases, versdes de promptjcadela, tipos de promptcadeia ‘tempo. Essa granularidade ajuda a entender variagdes de desempenho e identi car problemas especiticos. Registros e rastros -Métricas sio ipleamente agregadas. Eas condensam informagdes de eventos que focorrem no seu sistema ao longo do tempo. Eas ajudam voc@ a entender, raplda ‘mente, como seu sistema esté indo. No entanto, ha muitas perguntas que as métri-‘as no podem sjudar vocé a responder. Por exemplo, depois de ver um pico em ‘uma atividade especitica,vocé pode se perguntar: "Iso jé aconteceu antes?” Os logs podem ajudar voc’ a responder a essa pergunta, ‘emannee enemas. setone» cesso de depuragio pode se parecer com isto: 1, As métricas informam que algo deu errado hé cinco minutos, mas ndo infor- ‘mam o que aconteceu 2, Voce olha os registros de eventos que ocorreram cerca de cinco minutos atras para descobrir 0 que aconteceu. ‘3. Corrolacione os erros nos logs com as métricas para ter corteza de que vocd lo- calizau o problema certo. Para detecsao rapid, as métricas precisam ser computadas rapidamente. Para resposta rida, os logs precisam estar prontamente disponivets eacessives. Se seus logs estiverem com 15 minutos de atraso, voce teré que esperar que eles che- sguem para rastrear um problema que acontecew hd 5 minutos. Aenean tens pman ‘eapeetnnrenatemnans. seen point da API do modelo, nome do modelo, configuracses de amostragem (tempe- ratura, top:p, top, condo de parada, etc) e o modelo de prompt, Registre a consulta do usuario, o prompt final enviado ao modelo, a saidae as sai- das intermediarias, Registre se ele chama alguma ferramenta, Registre as saldas da ferramenta, Registre quando um componente inela, termina, quando algo tava, etc. Ao registrar um pedaco de log, certifiquese de dara ele tags e IDs que podem ajudar voc® a saber de onde esse log vem no sistema, Registrar tudo significe que « quantidatte de Togs que voce tem pode crescer ‘muito rapidamente. Multasferramentas para andlise automatlzada de logs ¢de- {ecgfo de anomalias de logs séo alimentadas por 1A. Embora seja impossivel processar logs manualmente, é wil inspecionar manual- ‘etommeeanmonnce tens. sone ‘es dos desenvolvedores sobre o que constitu saas boas e ruins mudam con- {orme eles interagem com mais dados, permitind que eles reescrevam seus prompts para aumentar a chance de boas respostas eatualizem seu pipeline de avaliaglo para capturar respostas ruins, Se os logs forem uma série de eventos desconexos, os rastros serdo reconstruidos vineulando eventos relacionados para formar uma linha do tempo completa de "uma transagio ou processo, mostrando como cada etapa se conecta do inicio a0 ‘Am, Em resumo, um rastro 60 registro detalhado do caminho de execugio de uma solieitagdo por melo de varios componentes e servigos do sistema. Em um. aplicativo de 1A, orastrolo revela todo o processo, desde quando um usuério en- via uma consulta até quando a resposta final é retornada, incluindo as agoes que sistema realiza, os documentos recuperados € 0 prompt final enviado ao mo- «Senn opmtn ‘ehmneeameennneannt. 5 totem» snenagao no uangomtn-‘Coase tettne Speirs ai — ne 0 une the pn SAconctnareenataens come a4 ° 3 score of te 203 5 on ® 5 chiefs se, raladelond} 0 in UNwin & faates 38. Anat o20r en0som o ete ayo osceon _ 5 By chcsnats Eee Ge4te 000em 22 th B20 ge bs aA PO uo "gr 101. rome esto nln plane hte pt, chnnnanmiaitennmnas. 26 come ficar a etapa exata em que ela deu errado: se foi processada incorretamente, se 0 contexto recuperado era irrelevante ou se o modelo gerow uma respostaerrada, Detecgio de deriva (Quanto mais partes um sistema tem, mais coisas podem mudar. Aqui esto algu: ‘mas coisas que poclem mudar em tum aplicaivo de 18 Alteragdes no prompt do sistema Ha muitos motivos pelos quais o prompt do sistema do seu aplicatve pode ‘mudar sem que voee saiba, 0 prompt do sistema pode ter sido criado em. cima de um modelo de prompt, e esse modelo de prompt foi atualizado. Um colega de trabalho pode ter encontrado umm erro de digitagto ecorrigido. nn Jonica simples deve ser suficiente para detectar quando o promptdo «Senn Spm Sine deemtninaietetint sO) -Mudangas no comportamento do usuario ‘Com 0 tempo, os usuarios adaptam seus comportamentos a tecnologia, Por lexemplo, as pessoas ja descobriram como enqquacrarstas consultas para ob- ter melhores resultados na Pesquisa Google ou como fazer seus artigos te- em uma classificagso mais alta nos resultados de pesquisa. Pessoas que vi- ‘ver em reas com carros auténomos ja descobriram como intimidar os car- ros auténomos para que Ihes deem o direito de passagem ( Liu etal. 2020) provavel que seus usuarios mudem seus comportamentos para obter me- Ihores resultados com seu aplicativo. Por exemplo, seus usuarios podem aprender a escrever instrugdes para tornar as respostas mais concisas. Isso pode causar uma queda gradual no comprimento da respasta ao longo do tempo. Se voc® olhar apenas para as métricas, pode no ser dbvio o que ca sou essa queda gradual. Investigagées para entender a causa raz s80 ‘ehannwatemrnnartemmnens._atteragoes no modelo suojacente ‘Ao usar um modelo por melo de uma APL 6 possivel que a APL permanesa inalterada enquanto 0 modelo subjacente éatualizada. Conforme mencio- nado no Capitulo 4 , 0 provedores de modelos podem nem sempre divulgar essas atualizagbes, deixando para vocd detectar qualsquer alteragbes. er~ ses diferentes da mesma API podem ter um impacto significative no desem- penho. Por exemplo, Chen. Zahatia ¢ Zou (2023) observaram diferencas no- tiveis nas pontuages de benchmark entre as verses de unho de 2023 & rmargo de 2023 do GPT-4 e GPT:35. Da mesma forma, o Voiceflow relatou uma queda de desempenho de 10% ao alternar do antigo GPT-35-turbo-0301 para o mais nove GPT-3.-turbo-1106, Orquestracao de pipeline de IA ‘eeannetemetraeteintess. de forramentas. Um orquestrador ajuda vor’ a especificar como esses diferentes componentes rabalham juntos para criar um pipeline de ponta a ponta. Ele ga zante que os dados fluam perfeitamente entre os componentes. Em um alto nivel, ‘um orquestrador opera em duas etapas: definigfo e encadeamento de ‘componentes: Deftnigao de Componentes ‘Voce precisa informar ao orquestrador quais componentes seu sistema usa, Jneluindo diferentes modelos, fontes de dados externas para recuperagdo & ferramentas que seu sistema pode usar. Um gateway de modelo pode facili- tara adiggo de um modelo, “Voce também pode informar ao orquestrador se usa alguma ferramenta para avaliago e monitoramento. ined stone» fungBes (componentes) juntas. No encadeamento (pipelining), voe® informa 1 orquestrador as etapas que seu sistema realiza desde o recebimento da consulta do usuario até a conclusdo da tarefa. Aqui esta um exemplo das tapas: tapa 1: processar a consulta bruta. tapa 2: recupere os dados relevantes com base na consulta processada, Etapa 3: consulta original eos dados recuperados sio combinados para criar um prompt no formato esperado pelo model. Etapa 4: o modelo gera uma resposta com base no prompt, Btapa 5: avalie aresposta ‘anew enmrnsetvonamnt. 8) ‘amine a consul para um operador humano, 0 orquestrador 6 responsével por passar dados entre componentes. Ele deve for- necer ferramentas que ajudem a garantir que a saida da etapa atual esteja no for mato esperado pela prdxima etapa, Mealmente, ele deve notficéto quando esse ‘uxo de dados for interrompido devido a erros, como falhas de componentes ou falhas de incompatibilidade de dados, Um orquestradar de pipeline de 1A € diferente de um orquestrador de fuxo de trabalho ge‘Ao projetaro pipeline para um aplicativo com requisitos de laténcia rigorosus, tensa ‘etna temas. a8) ‘ae remtugau we ru, aubes poder ser ren ao MeSH LEP. Existem muitasferramentas de orquestragao de 1A, ncluindo LansChain , Lia: rmalndes ,Flowise , Langflow e Haystack . Como recuperagio e o uso de ferra- _mentas sio padres comuns de aplicaivos, muitas estruturas RAG e de agentes também so ferramentas de orquestragio. [Embora sejatentador pular dieto para uma ferramenta de orquestragao a0 ini- iar um projeto, vooé pode querer comegar a construr seu apieativo sem uma pri ‘meiro, Qualquer ferramenta externa traz complexidade adicional, Um orquestra dor pode abtrair detalhes erticos de como seu sistema funciona, dificutando a compreensio a depuraco do seu sistema. CConforme vocé avanga para os estigios posteriores da pracesso de desenvalvi- tne pan ‘etannneemetraete tess. Incegracao e extensibilidade -Avaliese 0 orquestrador suporta os componentes que voré jd esté usando ou pode adotar no futuro. Por exemplo, se voc8 quiser usar um modelo Llama, ‘veriique se o orquestrador suporta isso, Considerando quantos modelos, bancos de dados ¢ frameworks existem, ¢ impossivel para um orquestrador suportar tudo, Portanto, vocé também precisard considerar a extensibilidade de um orquestrador. Se ele ndo suporta um componente especifico, qui di iil é mudarisso? ‘Suporte para pipetines comptexos A medida que seus aplicativs crescem em complexidade, voc8 pode preci- sar gorenclar pipelines intrincados envolvendo vérlas etapas elogiea conde ‘ehannetmnmoancete mans. sas complexidades de forma efciente, Facitidade de so, desempento e escalabitidade Considere a facilidade de uso do orquestrador. Procure por APIs intuitiva, documentagao abrangentee forte suporte da comunidade, pois isso pode re- dduzir significativamente a curva de aprendizado para vocé e sua equipe. Evite orquestradores que inieiam chamadas de API ocultas ou introduzem Jaténcia em seus [Link]ém disso, garanta que o orquestrador possa scalar efevamente conforme o nimero de aplicatves, desenvolvedores ¢ rafego eresee, Comentarios do usuario «tens Stmtan ‘anne esmemnsetvinamn. 8) ‘mar seu desenvolvimento. No entanto, em aplicativos de [A 0 feedback do usus- ro assume um papel ainda mals significativ. 0 feedback do usuario é um dado proprietirio, eos dados so uma vantagem competitiva. Um sistema de feedback do usuirio bem projetado énecessério para criar ovolante de dados discutido notenn Opman «Sten Speman ayaa (0 feedback do usuaio pode ser usado nao apenas para personalizar modelos para usuarios individuals, mas também para treinar futuras iteragbes dos mode Jos. Em uma era em que os dads sio cada vez mais escassos, os dados propriets- rosso mals vaiosos do que nunca, Um produto que é langado rapidamente e trai usuérios cedo pode reunir dados para methorar continuamente os modelos, ificultando que os concorrentes os aleancem, soialamhsas ian faadbackdassnssiasiadadss dousisia Alsuanca ‘ascnmemiegeomecetemnmes. direito de saber como seus dados estdo sendo usados. Extraindo Feedback Conversacional ‘Tradicionalmente, o feedback pode ser explicizo ou impricto 0 feedback explicito 6 ainformagio que os usuirios fornecem em resposta a solicitagaesexplicitas de feedback no aplicativo, como polegar para cima(polegar para baixo, voto positivojvoto negativo, classificagao por estrelas ou uma resposta sim/nao a per- {gunta "Resolvemos seu problema?”.0 feedback explicito é bastante padrao em to- os os aplicativos — hé apenas algumas maneiras de perguntar a uma pessoa se la gosta de algo, Portanto,o feedback expliito ¢ melhor compreendido, Peedback implicito ¢ informagio inferida de ages do usuro, Por exemplo, se al sani od wandada ale eanifies gua fal uma haa racazaie ‘esammtunmeomecete nnn. 4o aplicative. Modelos de fundagio permitem um novo mundo de aplicativos e, com eles, muitos géneros de feedback implicit ‘Alnterface de conversagso que muitos aplicatives de IA usam torna mals fell, para os usuérios darem feedback. Os usuarios podem encorajar bons comporta- 'mentos e corrigir ertos da mesma forma que dariam feedback em didlogos dié- ros. linguagem que tim usuario usa para dar instrugbes & 1A pode transmit fe- cedback sobre o desempenho do aplicaivo ea preferéncta do usuario Por exemplo, imagine que vocé est usando um assstente de IA para ajudar voce 4a planejar sua viagem para a Austria, Vocé pede para a LA encontrar um hotel ‘para vocé por trésnoites em Sydney. Ela responde com trés recomendacdes, como segue: tne pan ‘ehanme mannose te manss. Preco: ~$490/noite Bairro: Ruas charmosas e perto de pontos turisticos icénicos. Elegante Surry Hills House Hotel (Surry Hills) Preco: ~$200/noite Bairro: Moderno, com cafés © galerias de arte vibrantes. Hotel Chi21 Bondi Beachside (Bond Beach) Preco: ~$300/noite Bairro: A beira-nar, ideal para relaxar e explorar a cidade A maneira como vocé responde a essas trés recomendagSes revela sua preferén- cia, Por exemplo, se vocé responder com “sim, reserve para mim o que flea perto de galerias’, vocé demonstra interesse em arte, Por outro lado, a resposta "Nao {om nada abaixo de USS 200?" revela uma preferéneia consciente de prego esu- Rice eeecbeetetet assenvolvimento e personalizagao: + Avaliagdo: derivar métricas para monitorar a aplicagio + Desenvolvimento: treinar os modelos futures ou orientar seu desenvolvimento + PersonalizagSo: personalize oaplicativo para cada usustio| 0 feedback conversacional implicito pode ser inferido tanto do contedido das rmensagens do usuario quanto de seus padrdes de comunicagio, Como o feedback 6 misturado as conversas didrias, também & desafiador extrat-lo, Embora aintui- ‘80 sobre dicas conversacionais possa ajudé-lo a elaborar um conjuntoinicial de sinais a serem procurados, anaisesrigorosas de dados e estudos de usuarios io necessérios para entender. —__________Innbor o feecthack conversational tenha recchide maior atensto eracas A popye Aenean Seemememtenenes, Bh — {orgo tem tentado fazer com que algoritmos de RL aprendam com o feedback da linguagem natural desde o final da década de 2010, muitos deles com resultados promissores (Furet al 2019 ; Gaval, Nickum e Mooney, 2019 ; Zhou eSmal).2020 + Sumers et al.2020 ).0 feedback da linguagem natural também é de grande inte- ‘esse para os primeiros aplicativos de IA conversacional, como Amazon Alexa ( Ponnusamy etal, 2019 ; Park eta. 2020), 0 recurso de controle de voz do Spotity (Miao et al.2021 ) ¢0 Yahoo! Voice (ashimoto e Sassano , 2018) Feedback em linguagem natural O feedback extraido do contetido das mensagens ¢ chamado de feedback de lin- ‘guagem natural. Aqui esto alguns sinais de feedback de linguagem natural que Informam como uma conversa esta indo. E iil rastrear esses sinals na producto Se um usuario encerra uma resposta antes do tempo, por exempo,interrom- pendo a geragio de uma resposta no meio do caminho, saindo do aplicatvo (para aplicativos da Web e moves), dizendo ao modelo para parar (para assistentes de voz) ou simplesmente delxando o agente esperando (por exemplo, ndo respon- endo ao agente sobre qual opgi0 vocé deseja que ele prossiga), é provavel que a conversa néo esteja indo bem, Correcio de erros Se um usuario inicia seu acompanhamento com “Nao, ." ou “Eu quis dizer. resposta do modelo provavelmente esta errada, Para corrigir ertos, os usuarios podem tentar reformular suas sliitagbes. A EL: ours 10412 mast ode tentative di sdecorrigit a maken. ‘etonneeammomncete mts. eather inrisson by toy “Today in tsson Bay, San Francisca, the weathers mosty say wth terperatres ranging om 50°F 168 (13°C 120°C). Whee ae apace Rephrase with daifying information‘aay ntson Bay, San Dag, the weather party cloudy wth pathy fogin the marina, becoming most su tr the doy. Temparatures ar expecta orange tween 68 and ‘ehenetemenneanemms. eo. conoo wena a ‘nag ansaiisoergmar arene (05 usuarios também podem apontar coisas especificas que modelo deveria ter {olto diferente. Por exemplo, se um usuario pede ao modelo para resumir uma historia e.o modelo confunde um personagem, esse usuario pode dar feedback como: "Bll é suspeito, nda vitima’.O modelo deve ser capaz de pegar este fe- cedback erevisar oresumo. [Esse tipo de feedback de corregso de acto ¢ especialmente comum para casos de uso de agente, onde os usuérios podem cutucar 0 agente para ages mals opcio- nais, Por exemplo, se um usuérlo atribui ao agente a tarefa de fazer uma anélise de mercado sobre a empress XYZ, esse usuario pode dar um feedback como "Veet também deve verficar a pagina XYZ. do Gititub’ ou "Verifiqueo perfil X do CEO" «thems Stmitan ‘anne eanmmrnaetvonann. Isso ndo significa necessariamente que o modelo da respostas erradas. No en- tanto, pode significar que as respostas do seu modelo nao t&m as detalhes que o ‘usuario esté procurando, Também pode indicar desconfianga geral no set modelo, Alguns aplicativos permitem que os usuarios editem as respostas do modelo dire- ‘amente, Por exemplo, se um usuario pede ao modelo para gerar e6digo, € 0 usué- ro corrige o eéigo gerado, é um sinal muito forte de que o cédigo que fol editado no esté muito certo. As edigdes do usu também servem como uma fonte valiosa de dados de prefe- réncia. Lembre-se de que os dados de preferéncia, normalmente no formato de (consulta, esposta vencedora, resposta perdedora), podem ser usados para ali ‘enenneenenrnaeteminss. =f) caora ea resposta enitaaa senao a resposta vencecora, Reclamagies Frequentemente, os usuarios apenas reclamam sobre as saidas do seu aplicativo sem tentar corrig-las. Por exemplo, eles podem reclamar que uma resposta esté cerrada, ¢irrelevante, Oxia, longa, carece de detalhes ou ésimplesmente rum. A ‘Tabela 10-1 mostra oito grupos de feedback de linguagem natural resutances do agrupamento automiético do conjunto de dados FITS (Feedback for Interactive ‘Talk & Search) (Ku etal, 2022). ‘eho pee eis enor do agropamen toms do conn dade Grupo Tipo de feedback Namero, % tans man ‘atone inmmmncete mins. fornece informagdesirrelevantes ou (3) pede 20 suri para descobrir a resposta por conta propria, 3 Indique resultados de pesquisa especifcos que possum 2255 16.17% responder & pergunta4 Sugira que o bot use os resultados da pesquisa 2130 1527% 5 Afirma quea resposta € (1) factualmente incorretno 1572 11,27%% (2) no fundementada nos resultados da pesquisa. 6 Salienteque a resposta do bot nfo é 1309 930% specifcalprecisa/completadetalhada, 7 Ressalte que o bot nao estéconflante em suas se. 437% 8 Reclame sobre repetighojgrosseria nas respostas dos 187 099% ots, Entender como o bot falha com o usuario ¢ crucial para torné-lo melhor. Por exemplo, se voce sabe que o usuario nfo gosta de respostas prolixas, vocé pode al terar o prompt do bot para tornd:lo mais conciso, Seo usuario estiver infeliz por- que a resposta ndo tem detalhes, vocé pode solicitar que o bot seja mals especiticn. Sentimento Reclamagies também podem ser expressies gerais de sentimentos negativos (Grustragao, decepgfo,ridiculo, et) sem explicar 0 motivo. como "Ugh". Is0 pode soar distépico, mas.a analise dos sentimentos de um usuario durante conversas «tens Stmitan cada vez mais alt, algo estéerrado. Por outro lado, se alguém comeca uma con- versa com raiva, mas termina feliz, a conversa pode ter resolvido o problema, 0 feedback da linguagem natural também pode ser inferdo das respostas do mo- elo. Um sinal importante 6a axa de recusa do modelo . Se um modelo diz coisas como “Deseulpe, nfo sei disso” ou “Como modelo de linguagem, néo posso fa 2zer..", © usurio provavelmente fea infeliz, Outros comentarios de conversacao Existem outros tipos de feedback conversacional que podem ser derivados de ‘agdes do ususrio em ver de mensagens, Regeneracio Aten Opn ‘chenamegeencneonnns. ED ‘do estésatisflto com a primeira resposta. No entanto, também pode ser 0 caso dea primeira resposta ser adequada, mas o ususrio quer opsbes para comparar. Isso pode ser especialmente comum com solictagBes criativas, como geragio de imagem ou historia, 0s sinais de regenerasao também podem ser mals fortes para aplicativos com fa- ‘uramento baseado em uso do que aqueles com assinaturas, Com o faturamento Daseado em uso, os usurios tem menos probabilidade de regenerar e gastar dl mheiro extra por curiosidade ociosa Pessoalmente, eu frequentemente escolho a regeneracio para solicitagdes com- plexas para garantir que as respostas do modelo sejam consistentes. Se duas res- postas derem respostas eontraditrias, ndo podereiconflar em nenhuma delas tense ‘etanmeunmomncete mins.‘metnores ou piores, novamente, podem ser usados para ajuste fino de preferéncia, AE Eee, coven > LE i "301.0 Gong a pe ec oe gg ence. A snag ‘You might wonder: how about feedback when something good happens? Actions ‘that users can take to express their satisfaction include thumbs up, favoriting. oF sharing. However, Apples human interface guideline warns against asking for both positive and negative feedback. Your application should produce good re (usuarios estiverem felizes, eles continuardo usando seu aplicatve, [No entanto, muitas pessoas com quem converse acreditam que os usudrios de vem tera opcio de dar feedback quando encontrar algo ncrivel, Um gerente de produto de um produto popular com tecnologia de 1A mencionou que sua equipe precisa de feedback positivo porque ele revela os recursos que os uswrios amam Co suficiente para dar feedback entusiasmado. Isso permite que a equipe se con: centre em refinar um pequeno conjunto de reeursos de alto impacto em vez de es palhar recursos entre muitos com valores agregados minimos,tne pan Alguns evitam pedir feedback postivo por medo de que isso posta desorganizar a interface ou irritar os usuarios. No entanto, esse riseo pode ser gerenciado limi- tando a frequéncia de solicitagdes de feedback, Por exemplo, se voce tem wma arande base di sal mi ‘Stannsnmtnnrenntntas C8 veteue» ‘ustiios slicitadas, maior o risco de vieses de feedback. Ainda assim, com wm ‘pool grande o sufciente, o feedback pode fornecer insights signifativos sobre 0 produto. Como coletar feedback O feedback deve integrar-se perfetamente ao fuxo de trabalho do usudrio. Deve ser fil para os usuarios fornecerem feedback sem trabalho extra, A coleta de fe- ledback nao deve interromper a experiencia do usuario e ser cil de ignorar. Deve haver incentivas para que os ustérios deem um bom feedback. ‘um exemplo frequentemente eitado como bom design de feedback 6 0 do splice tivo gerador de imagens Midjourney. Para cada prompt, @ Midjourney gera um [Link] (auatea) imagens ed -seguintes ancies. cant a ine deemeteinsietetints ) cman + Gere uma verstio sem eseala de qualquer uma dessas imagens. + Gere variagdes para qualquer uma dessas imagens. + Regenerado, 9 class sottion: ee ee 2 TO] s ville >= and p2 = 6: 1 stp] > m0 02) ows) = msi(B1) rues = ons2ip2) enenen emma. oun ‘Midjourney qual das quatro fotos & considerada pelo usuério como a mas pro: rmissars. A opcio1 dé osinal postive mais forte sobre a foto escolhida, A op¢a 2 «dum sina positivo mais frac. A opgfo 3 sinaliza que nenhuma das fotos é boa 0 suficiente. No entanto, os usuérios pote escolher regenerar mesmo que as fotos existentes sejam boas apenas para ver o que mais € possivel. Code assistants like GitHtub Copilot might show thelr drafts in lighter colors than the final texts, as shown in Bigure 10-19, Users can use the Tab key to accept a sug- gestion or simply continue typing to ignore the suggestion, both providing feedback. o« a ‘enennesemenrnatemiess. =f) — @ me @ mens ‘Tete fest eens ne caret andthe | Thee etulens ae asec ith tote ‘aur stne na buttasd en the eemaaune | Zlet Heres rear ha al na ‘types on ine toning Understanding the Two-Tlled 2-Test| 4. two Sample 2: for Proportions ‘118 cthbcont eis ano ger un iar mange ‘Um dos maiores desafios de aplicatives de IA auténomos como ChatGPT e Claude 6 que eles ndo sto integrados ao Muxo de trabalho dirio do usuario, dfieutando a coleta de feedback de alta qualidade da maneira como produtos integrados como GitHlub Copilot podem, Por exemplo, se o Gmail sugerir um rascunho de e- ‘mail, 0 Gmail pode rastrear como esse rascunho é usado ou editado. No entanto, se voct usar 0 ChatGPT para escrever um e-mail, o ChatGPT néo saberd se 0 e-mail | tetees open ‘eemeeememmmrenenns. a ‘nas as informagbes de polegar para clma/poleyar para balxo ¢ util para caleular com que frequéncia as pessoas esto felizes ou insatisfeitas com seu produto, Para ‘uma andlise mais profunda, no entanto, vocé precisaria de contexto em torno do feedback, como 085 10 turnos de didlogo anteriores. Esse contexto pode ajudar vvoc# a descobrir o que deu errado, No entanto, obter esse contexto pode ndo ser possvel sem o consentimento explicito do usuario, especialmente se 0 contexto puder conter informacdes de identificagdo pessoal. Por esse motivo, alguns produtos incluem termos em seus contratos de servigo «que permitem que eles acessem das do usuario para analise e melhoria do pro-
You might also like
Wk02-Platform Architecture Design
PDF
No ratings yet
Wk02-Platform Architecture Design
91 pages
.NET 8 Microservices & API Design Guide
PDF
No ratings yet
.NET 8 Microservices & API Design Guide
15 pages
Components of a Generative AI Platform
PDF
No ratings yet
Components of a Generative AI Platform
26 pages
Developers Guide To Ai Ready Apis
PDF
No ratings yet
Developers Guide To Ai Ready Apis
12 pages
8 Warning Signs for AI App Failure
PDF
No ratings yet
8 Warning Signs for AI App Failure
22 pages
20 Common Web API Mistakes to Avoid
PDF
No ratings yet
20 Common Web API Mistakes to Avoid
22 pages
NextGen AI Architecture Blueprint
PDF
No ratings yet
NextGen AI Architecture Blueprint
4 pages
Technical Contribution
PDF
No ratings yet
Technical Contribution
9 pages
Web API Best Practices Guide
PDF
100% (1)
Web API Best Practices Guide
53 pages
Software Arch. File 3
PDF
No ratings yet
Software Arch. File 3
20 pages
Building Modern Business Applications: Reactive Cloud Architecture For Java, Spring, and PostgreSQL 1st Edition Peter Royal Ready To Read
PDF
No ratings yet
Building Modern Business Applications: Reactive Cloud Architecture For Java, Spring, and PostgreSQL 1st Edition Peter Royal Ready To Read
175 pages
REST API Security Cheat Sheet
PDF
No ratings yet
REST API Security Cheat Sheet
16 pages
Building Generative AI Services With FastAPI51
PDF
No ratings yet
Building Generative AI Services With FastAPI51
10 pages
AI Is Kind of Like A Sandwich - Patrick Hillman
PDF
No ratings yet
AI Is Kind of Like A Sandwich - Patrick Hillman
5 pages
Building Scalable Backend Systems
PDF
No ratings yet
Building Scalable Backend Systems
11 pages
2) LLM System Design Checklist
PDF
No ratings yet
2) LLM System Design Checklist
5 pages
Redis EPub Guide ContextArchitecte
PDF
No ratings yet
Redis EPub Guide ContextArchitecte
13 pages
API Security: Key Vulnerabilities and Solutions
PDF
No ratings yet
API Security: Key Vulnerabilities and Solutions
25 pages
Emit 2024
PDF
No ratings yet
Emit 2024
124 pages
Enterprise API Architecture Design Guide 2026
PDF
No ratings yet
Enterprise API Architecture Design Guide 2026
8 pages
AI Integration Best Practices Guide
PDF
No ratings yet
AI Integration Best Practices Guide
12 pages
API Strategy for Engineering Leaders
PDF
No ratings yet
API Strategy for Engineering Leaders
57 pages
API Governance and Security Best Practices
PDF
No ratings yet
API Governance and Security Best Practices
4 pages
Dotnet Professional Guide
PDF
No ratings yet
Dotnet Professional Guide
33 pages
Ai Overview
PDF
No ratings yet
Ai Overview
12 pages
Malware Project
PDF
No ratings yet
Malware Project
18 pages
Microservices API Gateway Solutions
PDF
No ratings yet
Microservices API Gateway Solutions
31 pages
Csc490 Note 1 - 已注解
PDF
No ratings yet
Csc490 Note 1 - 已注解
44 pages
Aspnet
PDF
No ratings yet
Aspnet
8 pages
Clean Architecture With ASP - Net Core
PDF
100% (1)
Clean Architecture With ASP - Net Core
49 pages
Mastering RAG CH 2
PDF
No ratings yet
Mastering RAG CH 2
34 pages
Claude Mythos - Governance Importance
PDF
No ratings yet
Claude Mythos - Governance Importance
10 pages
AI Application Development Platforms Guide
PDF
No ratings yet
AI Application Development Platforms Guide
38 pages
Vulnerable REST API Setup Guide
PDF
No ratings yet
Vulnerable REST API Setup Guide
14 pages
Capturing Tacit Knowledge Through Generative AI
PDF
No ratings yet
Capturing Tacit Knowledge Through Generative AI
7 pages
Dzone Refcard 303 Api Integration Patterns 2022
PDF
No ratings yet
Dzone Refcard 303 Api Integration Patterns 2022
8 pages
AI Product System Architecture Guide
PDF
No ratings yet
AI Product System Architecture Guide
10 pages
Week9 Architecture Document
PDF
No ratings yet
Week9 Architecture Document
15 pages
HLD Design Case Study Designing Yelp
PDF
No ratings yet
HLD Design Case Study Designing Yelp
12 pages
API Lifecycle Management for Mobile Devices
PDF
No ratings yet
API Lifecycle Management for Mobile Devices
4 pages
Overcoming Two Issues That Are Sinking Gen Ai Programs
PDF
No ratings yet
Overcoming Two Issues That Are Sinking Gen Ai Programs
6 pages
API Engineering
PDF
No ratings yet
API Engineering
12 pages
Mastering Enterprise Web Architecture
PDF
No ratings yet
Mastering Enterprise Web Architecture
5 pages
7 Principles For Effective and Cost-Efficient Generative AI Apps
PDF
No ratings yet
7 Principles For Effective and Cost-Efficient Generative AI Apps
28 pages
The AI Security Gap - Davide Annovazzi and Gabriele Zanoni
PDF
No ratings yet
The AI Security Gap - Davide Annovazzi and Gabriele Zanoni
18 pages
Social Practices of Rule Making in World Politics Mark Raymond Ebook PDF
PDF
100% (1)
Social Practices of Rule Making in World Politics Mark Raymond Ebook PDF
163 pages
Apigee vs MuleSoft: Platform Engineering Insights
PDF
No ratings yet
Apigee vs MuleSoft: Platform Engineering Insights
14 pages
Model Processing Framework for IS Evaluation
PDF
No ratings yet
Model Processing Framework for IS Evaluation
78 pages
Reasons API Initiatives Fail
PDF
No ratings yet
Reasons API Initiatives Fail
11 pages
Enterprise Backend Architecture & Schema
PDF
No ratings yet
Enterprise Backend Architecture & Schema
17 pages
Securing REST APIs: Best Practices
PDF
No ratings yet
Securing REST APIs: Best Practices
18 pages
Gateway Value Report
PDF
No ratings yet
Gateway Value Report
14 pages
Doc2 Responsible AI Governance
PDF
No ratings yet
Doc2 Responsible AI Governance
14 pages
Long-lasting API Design Strategies
PDF
No ratings yet
Long-lasting API Design Strategies
153 pages
Understanding the Platform Layer in AI
PDF
No ratings yet
Understanding the Platform Layer in AI
93 pages