zaterdag 19 maart 2011

Weetje: PHP client onder Windows 2008

Soms moet je wel eens wat analyses doen op bijvoorbeeld responsetijden van een search omgeving.

Ik gebruik dan vaak de command line PHP client omdat PHP zo lekker makkelijk én uitgebreid is.

Nu had ik laatst een Windows 2008 R2 omgeving waarop Autonomy draaide. Om de performance te meten had ik een script gemaakt die alle zoekopdrachten uit een query log file haalde en die stuk voor stuk afvuurde op de action port.

Het lukt echter niet om PHP te starten (php –v). Dit gaf de melding:

“The application has failed to start because its side by side configuration is incorrect.  Please see the application event log for more detail.”

Na wat zoeken kwam ik op het antwoord. Je moet de “Microsoft Visual C++ 2008 SP1 Redistributable Package (x64)” installeren.

Daarna werkte het wel.

vrijdag 18 maart 2011

Autonomy IDOL 7 weetje: Database Readonly

Vandaag heb ik een nieuwe Autonomy IDOL (7) omgeving opgezet op een nieuwe server bij een klant.

Na de verschillende stappen doorlopen te hebben zoals:

1. IDOL7 installeren
2. Configuratie van de oude server kopiëren
3. IDOL7 starten
4. Controleren of alles werkte

ben ik de export van de oude server gaan indexeren (http://localhost:9001/DREADD?filenaam.idx.gz).

Daarbij bleek dat de documenten uit de export files niet werden geindexeerd. In de content_index.log file stond:

18/03/2011 22:28:00 [1] Database (XXX) is readonly

Wat? Hoe kan dat nou? Ik had dat zeker niet geconfigureerd. Na wat onderzoek bleek dat de bestaande databases allemaal de instelling DatabaseReadOnly=TRUE hadden meegekregen. Dit heeft IDOL spontaan zelf toegevoegd.

Nadat ik dit had gewijzigd in DatabaseReadOnly=false en een restart van de AutonomyIDOLService kon ik de exportbestanden wel indexeren.

Waarschijnlijk heeft IDOL na het voor de eerste keer starten van de engine met een bestaande configuratie de databases aangemaakt én deze op readonly gezet.

Een weetje voor wanneer je een Autonomy IDOL instance naar een andere server gaat verplaatsen.

Microsoft positioneert Sharepoint nu ook als Enterprise search product

Microsoft is bezig met een opmars op het gebied van Enterprise Search en ze gebruiken Sharepoint als vervoermiddel.

Enterprise Search Resource Center | SharePoint 2010
Find overviews, how-to topics, and other resources to help you develop and deploy Enterprise Search solutions in SharePoint Server 2010

Het is bijzonder om te zien dat Sharepoint nu in één adem wordt genoemd met "Enterprise Search". Tot dit moment hebben de zoekoplossingen van Microsoft altijd een aparte plek gehad. Denk aan de Microsoft Search Server, Microsoft FAST Search Server etc. Sharepoint wordt zo echter wel een product dat bijna alles schijnt te zijn:
- CMS
- DMS
- Website
- Portaal
- zoekmachine
- samenwerkomgeving
- en wat nog meer?

bron: http://msdn.microsoft.com/en-us/sharepoint/gg618546.aspx

donderdag 17 maart 2011

Meetbaarheid ROI van een zoekoplossing

Forrester heeft op 14-03-2011 een rapport uitgebracht over het gebruik van Search Based Applications (SBA).

Belangrijke opmerking in de samenvatting bij dit rapport is dat het heel moeilijk is om de ROI te meten van een “one-size-fits-all” zoekapplicatie.

Omdat een search based application (SBA) zich ín een applicatie of werkproces nestelt zijn de resultaten echter wel meetbaar. Het gaat daar immers vaak om eenheden van behandeling of verwerking.

Een zoekapplicatie die voor zogenaamde “horizontale” (over verschillende diverse bronnen of repositories heen) toegang tot documenten en informatie zorgt is te algemeen om éénduidig return on investment te meten.

Edwin Stauthamer, 17-03-2011

Reactie op artikel “Google geeft me antwoord”

In de Metro heeft op 14-03-2011 een artikel gestaan over de lancering van een site van de politie met antwoorden op vragen over allerlei zaken die jongeren aangaan.

Een student heeft op dit artikel gereageerd met de volgende tekst:

“Ze kunnen beter iets anders doen, iets compleet nieuws dat er nu nog niet is. Tegenwoordig maken zoekmachines op het internet, zoals bijvoorbeeld Google, al die websites met voorlichting overbodig…”

Ik moest hierom lachen. Als er geen sites met voorlichting (lees informatie) zijn, hoe kunnen de zoekmachines dan antwoorden geven?

Edwin Stauthamer, 17-03-2011

Exalead geselecteerd als zoekplatform voor La Bibliotheque Nationale de France

Exalead timmert nog steeds aan de weg als leverancier van Search technology. Sinds de overname door Dassault Systems is de toekomst van Exalead als merk onzeker.

Vorig jaar kon Exalead Nederland nog niets zeggen over de toekomst vanwege de overname, maar door deze grote opdracht laat Exalead zien dat ze het product ook apart staande kunnen houden.

Exalead staat bekend als de leverancier van “Search based applications”. Het gaat daarbij niet zozeer om het leveren van een stand-alone zoekoplossing, maar het integreren met bestaande applicaties om zodoende optimaal te integreren met bedrijfsprocessen.

Bron: http://sg.news.yahoo.com/bc-dassault-systemes-20110315-230027-652.html

woensdag 13 oktober 2010

Toelichting op het fenomeen "stopwoorden"

Ik heb al vaak uitgelegd wat "stopwoorden" zijn in de context van een zoekomgeving en waarom het gebruiken van een stopwoordenlijst van belang is.
Mijn laatste zeer korte toelichting wil ik hierbij delen:

Onze taal bevat veel worden die feitelijk geen betekenis geven aan de inhoud van een zin maar wel veelvuldig worden gebruikt. Duidelijke voorbeelden zijn woorden als “de”, “het” en “een”.

Voor een zoekopdracht zijn deze worden betekenisloos en verzwarend als ze in de index zitten. Als je zoekt op “de hond”, dan gaat er uiteraard om het zelfstandig naamwoord “hond”.

Het gaat echter ook om werkwoorden die geen betekenis toevoegen. Denk daarbij aan “worden”, “zullen”etc.

Een zoekmachine probeert onderscheid te maken tussen relevante en niet-relevante informatie die in de indexen zelf zit, zodat tijdens het zoeken gebruik kan worden gemaakt van het gegeven of een zoekwoord voor een bepaald document meer of minder relevant is.
De uitkomst daarvan zorgt er weer voor dat bepaalde documenten hoger of lager in de resultaatlijst komen te staan.

Stopwoorden zullen tijdens het indexeren uit de content worden gehaald. Ook bij het stellen van de zoekvraag worden woorden die in de stopwoordenlijst staan, verwijderd.
Het is dus ook niet mogelijk om te zoeken op woorden die in de stopwoordenlijst staan, omdat die woorden gewoonweg niet in de index voorkomen!!!

Door het aanleggen van een goede, domeinspecifieke, stopwoordenlijst zal de relevantie van gevonden informatie dus toenemen en zal de snelheid verbeteren.