Chunking¶
burmesenlp.chunking.chunk ¶
chunk(text: str, *, lexicon: Optional[Lexicon] = None, grammar: Optional[CompiledGrammar] = None, gazetteer: Optional[GazetteerManager] = None, use_gazetteer: bool = True) -> List[Chunk]
Normalize → segment → POS → optional gazetteer → phrase chunk.
When use_gazetteer is True (default), entity spans are locked as NP
the same way as BurmeseNLP.process. Pass use_gazetteer=False for
a fast syntax-only pass, or inject a preloaded GazetteerManager.
Source code in src/burmesenlp/chunking/chunker.py
burmesenlp.chunking.chunk_from_tokens ¶
chunk_from_tokens(words: Sequence[str], pos_tags: PosInput, *, grammar: Optional[CompiledGrammar] = None, entities: Optional[Sequence[GazetteerHit]] = None, clauses: bool = False, sentence_bounds: Optional[Sequence[SentenceBound]] = None) -> List[Chunk]
Source code in src/burmesenlp/chunking/chunker.py
burmesenlp.chunking.PhraseChunker ¶
Shallow phrase chunker: consumes words + POS, never mutates tags.
Source code in src/burmesenlp/chunking/chunker.py
chunk ¶
chunk(words: Sequence[str], pos_tags: PosInput, *, entities: Optional[Sequence[GazetteerHit]] = None, clauses: bool = False, sentence_bounds: Optional[Sequence[SentenceBound]] = None) -> List[Chunk]
Chunk phrases, optionally locking gazetteer entity spans as NP.
Parameters¶
entities:
Post-BMWE gazetteer hits. Each span is emitted as one NP with
features["entity"] set, and is blocked from further POS
pattern matching.
Source code in src/burmesenlp/chunking/chunker.py
split_clauses ¶
split_clauses(words: Sequence[str], pos_tags: PosInput, *, sentence_bounds: Optional[Sequence[SentenceBound]] = None) -> List[Chunk]
Deprecated: clause overlays removed from the phrase chunker.
Returns []. Prefer :class:ClauseParser.
Source code in src/burmesenlp/chunking/chunker.py
burmesenlp.chunking.models.Chunk
dataclass
¶
Chunk(type: ChunkType, text: str, tokens: List[str], pos_tags: List[str], start: int, end: int, features: Mapping[str, str] = dict())
A shallow phrase span over already-tagged tokens.
start / end are inclusive token indices into the input sequence.
burmesenlp.chunking.models.ChunkType ¶
Bases: Enum