Wataru Tsukahara

12 papers A* 1A 1B 4Journal 1Unranked 5
YearRankTypeTitle / Venue / Authors
2009 conf
HCI (8)
Hironori Egi, Shotaro Houri, Yukari Kato, Tatsuya Terada, Wataru Tsukahara, Masaki Nakagawa
2009 B conf
ICALT
Yukari Kato, Shotaro Houri, Wataru Tsukahara, Hironori Egi, Masaki Nakagawa
2007 B conf
ICALT
Satoko Amemiya, Kazunori Hasegawa, Keiichi Kaneko, Haruko Miyakoda, Wataru Tsukahara
2007 B conf
ICALT
Wataru Tsukahara, Zhang Zisheng, Shingo Akamatsu, Fumihiko Anma, Toshio Okamoto
2006 conf
ITEM
Wataru Tsukahara, Fumihiko Anma, Ken Nakayama, Toshio Okamoto
2006 conf
ITEM
Toshie Ninomiya, Wataru Tsukahara, Toshiaki Honda, Toshio Okamoto
2005 conf
CELDA
Wataru Tsukahara, Ken Nakayama, Fumihiko Anma, Toshio Okamoto
2005 B conf
ICALT
Kazuya Seki, Wataru Tsukahara, Toshio Okamoto
2003 J jnl
Int. J. Hum. Comput. Stud.
Nigel Ward, Wataru Tsukahara
2001 A* conf
CHI
Wataru Tsukahara, Nigel Ward
2000 A conf
INTERSPEECH
Wataru Tsukahara, Nigel Ward
1998 conf
ICSLP
Wataru Tsukahara
redb/extractors/js_extractors/js_content.py
← Index redb/extractors/js_extractors/js_content.py python
"""Persists raw + normalised text into the generic `code_text_content` table.

Reads the raw source and the deobfuscation result directly from the shared
JSContext so no extra compute happens here — both values are computed once
per sample (the source at JSContext construction, the deobfuscation lazily
on first access) and reused by any extractor that needs them.

`text_normalized` is left NULL when the deobfuscation pass produced no
output, so analysts can distinguish "we tried and got nothing" from
"normalisation succeeded".
"""

import inspect
from datetime import datetime, timezone
from typing import Any

from redb.extractors.enum import Tag
from redb.extractors.js_extractor import JSExtractor


class JSContentExtractor(JSExtractor):

    def __init__(
        self, filepath, log, exporters=None, index_prefix=None,
        known_benign=False, known_malicious=False, source=None, context=None,
    ):
        super().__init__(
            filepath, log, exporters, index_prefix,
            known_benign, known_malicious, source, context=context,
        )
        self.content_row = None
        self.log.debug(inspect.currentframe().f_code.co_name)

    def tag(self):
        return Tag.JS_CONTENT.value

    def extract(self):
        src = self.js_source
        if not src:
            return None

        deobfuscated, normalizer_used = self._context.deobfuscated

        self.content_row = {
            "content_type": self._context.content_type,
            "text_raw": src,
            "text_normalized": deobfuscated,  # may be None
            "normalizer_used": normalizer_used,  # may be None
        }
        return self.content_row

    def prepare_export_data(self, exporter_type: str) -> Any:
        if exporter_type != "ClickHouseExporter":
            return None
        if not self.content_row:
            return None

        r = self.content_row
        data = [[
            self.sha256,
            r["content_type"],
            r["text_raw"],
            r["text_normalized"],
            r["normalizer_used"],
            datetime.now(timezone.utc),
        ]]

        column_names = [
            "sha256",
            "content_type",
            "text_raw",
            "text_normalized",
            "normalizer_used",
            "analysis_date",
        ]

        column_type_names = [
            "FixedString(64)",
            "LowCardinality(String)",
            "String",
            "Nullable(String)",
            "Nullable(String)",
            "DateTime64(3, 'UTC')",
        ]

        return (data, column_names, column_type_names)

    def get_clickhouse_table(self) -> str:
        return "code_text_content"