Karthik Kuber

14 papers A 1B 1Unranked 12
YearRankTypeTitle / Venue / Authors
2025 conf
SIGCSE (2)
En-Shiun Annie Lee, Sean Woodhead, Karthik Kuber, Hashmat Rohian, Stacey A. Koornneef
2025 conf
BIBM
Xinyuan Huang, Hikaru Kurosawa, Jack Wunder, Sujit Patil, Jiechao Gao, Karthik Kuber, Jonathan C. Irish, Michael J. Daly
2021 conf
ITiCSE-WGR
James H. Paterson, Joshua Adams, Laurie White, Andrew Csizmadia, Deger Cenk Erdil, Derek Foster, Mark Hills, Zain Kazmi, Karthik Kuber, Sajid Nazir, Majd Sakr, Lee Stott
2021 A conf
SIGCSE
En-Shiun Annie Lee, Karthik Kuber, Hashmat Rohian, Sean Woodhead
2021 conf
ITiCSE (2)
James H. Paterson, Joshua Adams, Laurie White, Andrew Csizmadia, Deger Cenk Erdil, Derek Foster, Mark Hills, Zain Kazmi, Karthik Kuber, Sajid Nazir, Majd Sakr, Lee Stott
2020 B conf
ITiCSE
Joshua Adams, Brian Hainey, Laurie White, Derek Foster, Narine Hall, Mark Hills, Sara Hooshangi, Karthik Kuber, Sajid Nazir, Majd Sakr, Lee Stott, Carmen Taglienti
2020 conf
ITiCSE-WGR
Joshua Adams, Brian Hainey, Laurie White, Derek Foster, Narine Hall, Mark Hills, Sara Hooshangi, Karthik Kuber, Sajid Nazir, Majd Sakr, Lee Stott, Carmen Taglienti
2016 conf
GECCO (Companion)
Ryan J. Urbanowicz, Will N. Browne, Karthik Kuber
2016 conf
GECCO (Companion)
Karthik Kuber, Masaya Nakata, Kamran Shafi
2014 conf
GECCO (Companion)
Karthik Kuber, Stuart W. Card, Kishan G. Mehrotra, Chilukuri K. Mohan
2014 conf
GECCO (Companion)
Karthik Kuber, Stuart W. Card, Kishan G. Mehrotra, Chilukuri K. Mohan
2012 conf
SEMCCO
Karthik Kuber, Stuart W. Card, Kishan G. Mehrotra, Chilukuri K. Mohan
2010 conf
GECCO (Companion)
Karthik Kuber, Chilukuri K. Mohan
2009 conf
GECCO (Companion)
Karthik Kuber, Chilukuri K. Mohan
tests/unit/test_decompile_strings.py
← Index tests/unit/test_decompile_strings.py python
"""Unit tests for bninja/analysis/strings.py — StringAnalysis."""
import pytest
import math
from unittest.mock import MagicMock


# StringAnalysis has no binaryninja imports, just collections and math
from redb.extractors.decompiler.bninja.analysis.strings import StringAnalysis


# ============================================================================
# Helper mocks
# ============================================================================

class MockStringEntry:
    """Mock for a Binary Ninja string reference."""
    def __init__(self, value, raw=None, start=0, length=0, type_name="Utf8String"):
        self.value = value
        self.raw = raw if raw is not None else (value.encode("utf-8") if isinstance(value, str) else value)
        self.start = start
        self.length = length if length else len(self.raw)
        self.type = MagicMock()
        self.type.name = type_name


class MockBinaryView:
    """Mock binary view with a strings list."""
    def __init__(self, strings=None):
        self.strings = strings or []


# ============================================================================
# 6a. StringAnalysis
# ============================================================================


class TestStringAnalysisEntropy:
    def setup_method(self):
        self.sa = StringAnalysis(bv=MockBinaryView(), functions=[])

    def test_entropy_empty_string(self):
        assert self.sa.entropy("") == 0.0

    def test_entropy_single_char(self):
        assert self.sa.entropy("aaaa") == 0.0

    def test_entropy_uniform_distribution(self):
        # "abcd" -> 4 unique chars, each p=1/4, entropy = log2(4) = 2.0
        result = self.sa.entropy("abcd")
        assert result == pytest.approx(2.0)

    def test_entropy_binary_string(self):
        # "ab" -> 2 unique chars, each p=1/2, entropy = log2(2) = 1.0
        result = self.sa.entropy("ab")
        assert result == pytest.approx(1.0)


class TestStringAnalysisAnalyze:
    def test_analyze_deduplication(self):
        """Duplicate (string, encoding) pairs -> only first kept."""
        entries = [
            MockStringEntry("hello", start=100, type_name="Utf8String"),
            MockStringEntry("hello", start=200, type_name="Utf8String"),
        ]
        bv = MockBinaryView(strings=entries)
        sa = StringAnalysis(bv=bv, functions=[])
        result = sa.analyze()
        assert len(result) == 1
        assert result[0]["string_offset"] == 100

    def test_analyze_sorted_by_address(self):
        """First occurrence (lowest offset) is the one kept."""
        entries = [
            MockStringEntry("world", start=500, type_name="Utf8String"),
            MockStringEntry("world", start=100, type_name="Utf8String"),
        ]
        bv = MockBinaryView(strings=entries)
        sa = StringAnalysis(bv=bv, functions=[])
        result = sa.analyze()
        assert len(result) == 1
        # The analyze() sorts by start, so 100 comes first
        assert result[0]["string_offset"] == 100

    def test_analyze_empty_bv(self):
        bv = MockBinaryView(strings=[])
        sa = StringAnalysis(bv=bv, functions=[])
        result = sa.analyze()
        assert result == []

    def test_analyze_output_schema(self):
        entries = [MockStringEntry("test_string", start=0, type_name="Utf8String")]
        bv = MockBinaryView(strings=entries)
        sa = StringAnalysis(bv=bv, functions=[])
        result = sa.analyze()
        assert len(result) == 1
        r = result[0]
        required_keys = [
            "string",
            "string_raw",
            "string_encoding",
            "string_offset",
            "string_length",
            "string_raw_length",
            "string_entropy",
        ]
        for key in required_keys:
            assert key in r, f"Missing key: {key}"