コンテンツプロファイル
お客様のページにPiano Insight の JavaScriptがあることによって、Piano のウェブロボットがそれらのページを定期的にクロールします。クロールされたページはその後構文解析され、それぞれのページから抽出されたテキストは意味を解析されコンテンツプロファイル作成のために要約されます。このようにしてコンテンツプロファイルは、トピックとページのテーマを伝えるある種の"指紋"と考えられています。論理的にコンテンツプロファイルは、以下3つを1セットと考えることができます:
アイテム:興味・関心を持ってくるある種の文字列。しばしばアイテムは、ページで実際に見つかる正規化されたバージョンですが、平等にカテゴリー名あるいはその他となります。
重み: Tf-idfによって算出された、ページ上でのアイテムの相対的重要度を表した数値。
グループ名:アイテムのタイプを示している文字列。グループ名はどのようにして意味的にアイテムを解釈するかを一般的に識別します。例えば、アイテム「john smith」は、人名を含んでいるグループ名「person」を持つでしょう。
コンテンツプロファイルは、以下の例のようなPiano プラットフォームの多くの設定とアプリケーションで使われます:
ユーザー興味・関心のプロファイル作成のコンポーネントとして。
コンテクスチャルな3rdパーティアプリケーションの作成のコンポーネントとして。
コンテンツ関連のレコメンデーションを生み出す基礎として。
コンテクスチャルな広告のマッチングの基礎として。
ユーザープロファイル内での異なるエレメントは、異なるものに対して使うことができます。 |
グループ名
コンテンツプロファイルを生成によって行われる言語上の処理は言語特有なので、コンテンツプロファイル内で見つかるどのグループ名も一般的に言語単位で変化します。言語特有の処理を送り出すために、コンテンツの処理の間発生する最初のステップの1つは、言語の識別です。例えば、日本語のテキスト処理方法は、スペイン語のテキスト処理方法と比べまったく違います。
コンテンツプロファイル内で共通して見つかるグループは以下のテーブルの一覧の通りで、これらのグループに属しているアイテムの解釈方法の内容も一緒に記載しています:
グループ名 | 内容 |
|---|---|
| ページ上には頭字語として定義されている文字列があります。例えば、federal bureau of investigation という文字列は「FBI」という文字が何を表しているかを実際に定義しているページから抽出されます。レポートされる値は長文式となります。 |
| 誰かがCxense Advertising内で購入したアクティブなキーワードの文字列です。例:もし誰かが与えられたキーワードを購入する場合、キーワード (あるいはそこに適したバリエーション)を含んだページは、コンテンツプロファイル内に入札したキーワードを保持している可能性があります。 |
URLパス
| ある種のカテゴリー名を指し示す文字列です。通常、URLの構造から推測されるものであり、取得されないケースも起こりえます。 URLからの推測はURLをパスのコンポーネントに分割し、カテゴリの可能性が低いコンポーネントの削除はヒューリスティックスを適用されることによって行われることにご注意ください。現在のヒューリスティックスでは例えば5つのコンポーネントだけが抽出され、コンポーネントは2〜20文字以内でなければならず、数値は抽出されません。http://www.example.com/2015/11/sports/baseball/yankees-beat-red-sox のようなURLでは カテゴリの sports と baseball が抽出されます。こうしたヒューリスティックスがうまく動作しない可能性もありますので、ドキュメント内にタクソノミのメタタグを含めることによって、 category を上書きすることができます。詳しくは Document parsing をご覧ください。
|
classification | 自動的に検出された話題のコンテンツを示す文字列です。例えば arts-and-entertainment という業種分類は cXenseParse タグで上書きすることもできます。 今後変更されるかもしれませんが、分類カテゴリは IAB Tech Lab Content Taxonomy のトップレベルに合わせていきます。現時点で、自動分類は英語、スペイン語、ノルウェー語、日本語でサポートされています。 |
会社名
| 会社名と推測される文字列。例:microsoftあるいはapple corporation |
ページ中の主要キーワード
| コンセプトを含んだ文字列です。必須ではありませんが、一般的には文法上の名詞句です。conceptはまた頻出用語や2つ3つのフレーズを含んでいます。 日本語の処理においては、長さが2文字以下の名詞句は基本的にはconceptとして抽出されません。ただし、2文字以下でもいくつかの特定の語はホワイトリスト化して抽出するようにしています。 |
| 特定の名称と推測される文字列です。例:ブランド名あるいは製品名、あるいは映画の名前あるいはその他の名前。 |
言語
| ページの言語を示す文字列です。例:スペイン語のページは、コンテンツプロファイル内に「es」を持ちます。 |
地名
| 地名と推測される文字列。例:new york cityあるいはtokyo。 |
ページ種別
| articleあるいはfrontpage |
人名
| 人名と推測される文字列。例:john smith |
| コンテンツプロファイルに問題があることを示すもので、以下のようなものがあります。
|
| (日本語未対応) |
| (日本語未対応) 関連性のないコンテンツを持っていることが検出されたページが、プロファイル内にこのキーを持つ文字列「negative」を含みます。 |
ドメイン名
| サイト名あるいはドメイン名。例:vg.noあるいはcxense.com |
URL階層
| 値が完全なカテゴリーパスを示す文字列です。必須ではありませんが、一般的にはURL構造から推測されます。 categoryも合わせてご確認ください。 |
| ページのキーワード。通常は keyword メタタグで明示的に指定します。 |
| webmetric で定義されている javascript 変数。 |
| The http://schema.org itemtype metadata. |
publishdate | 記事が発行された日付。例: 2019-01-01(UTC時間) |
他のキーで発生する可能性もあります。例えば、お客様の固有の業務用語、意味合いを持って定義されたグループ名を含むようなメカニズムが存在する場合です。 |
サポートされている言語
上述のように、構造化されていないテキストの処理には言語特有のアルゴリズムと用語のリソースを利用します。サポートされている言語は以下のとおりです:
アフリカーンス語、アラビア語、ベンガル語、中国語(簡体字・繁体字)、チェコ語、デンマーク語、オランダ語、英語、エストニア語、ドイツ語、フィンランド語、フランス語、ギリシャ語、ヘブライ語、ヒンディー語、ハンガリー語、アイスランド語、インドネシア語、イタリア語、日本語、韓国語、ラトビア語、リトアニア語、マレー語、ノルウェー語、ポーランド語、ポルトガル語、ルーマニア語、ロシア語、セルビア語、スロバキア語、スロベニア語、スペイン語、スウェーデン語、タイ語、トルコ語、ウルドゥー語