使用pdfbox2.0.15版本,将pdf文件转为图片时,中文显示乱码

一、问题

在项目中使用pdfbox2.0.15版本,将pdf文件转成图片,在windows本地转换正常,发布到linux服务器,转换后图片中的中文出现部分乱码,显示都是方块□□□。

二、分析

1、日志查看

后台日志打印出的日志显示,pdf识别出的字体为STSongStd-Light,服务器没有这个字体库,所以按照默认匹配规则,匹配到了UnDotum-Bold这种字体,经查询,UnDotum-Bold主要为韩语字体,无法匹配所有中文字体,所以出现方块□□□。

2019-12-25 14:50:12.308 [http-nio-9281-exec-9] WARN  o.a.p.pdmodel.font.PDCIDFontType0 -Using fallback UnDotum-Bold for CID-keyed font STSongStd-Light
2019-12-25 14:50:12.309 [http-nio-9281-exec-9] WARN  o.a.pdfbox.rendering.CIDType0Glyph2D -No glyph for 27748 (CID 0e13) in font STSongStd-Light

2、瞎折腾

根据网上资料显示,因服务器缺少字体库STSongStd-Light,既然是这样,自然是找到对应的字体库放到服务器上(linux添加字体库教程自行google)。经过一番折腾,字体是有了,但是依旧显示乱码,日志还是显示加载的是UnDotum-Bold,此方法不通只能走其他路子了。

3、源码分析

通过断点调试,在FontMapperImpl类中发现有个substitutes 列表,存放的是字体名称的映射关系,即一种字体不存在时,可以根据这个映射关系,优先匹配对应的字体,部分源码如下:

final class FontMapperImpl implements FontMapper
{
   
    private static final FontCache fontCache = new FontCache(); // todo: static cache isn't ideal
    private FontProvider fontProvider;
    private Map<String, FontInfo> fontInfoByName;
    private final TrueTypeFont lastResortFont;

    /** Map of PostScript name substitutes, in priority order. */
    private final Map<String, List<String>> substitutes = new HashMap<String, List<String>>();

    FontMapperImpl()
    {
   
        // substitutes for standard 14 fonts
        substitutes.put("Courier",
                Arrays.asList("CourierNew", "CourierNewPSMT", "LiberationMono", "NimbusMonL-Regu")
你可以使用 Apache PDFBox 库将 HTML 换为 PDF。下面是一个使用 PDFBox 的示例代码: ```java import java.io.File; import java.io.FileInputStream; import java.io.FileOutputStream; import java.io.IOException; import org.apache.pdfbox.pdmodel.PDDocument; import org.apache.pdfbox.pdmodel.PDPage; import org.apache.pdfbox.pdmodel.PDPageContentStream; import org.apache.pdfbox.pdmodel.PDPageTree; import org.apache.pdfbox.pdmodel.common.PDRectangle; import org.apache.pdfbox.pdmodel.common.PDStream; import org.apache.pdfbox.rendering.PDFRenderer; import org.apache.pdfbox.tools.imageio.ImageIOUtil; public class HTMLtoPDFConverter { public static void main(String[] args) { String htmlFilePath = "path/to/input.html"; String pdfFilePath = "path/to/output.pdf"; // Load HTML file File htmlFile = new File(htmlFilePath); try { // Create a new PDF document PDDocument document = new PDDocument(); PDPage page = new PDPage(PDRectangle.A4); document.addPage(page); // Create a PDPageContentStream object PDPageContentStream contentStream = new PDPageContentStream(document, page); // Load the HTML file into a PDStream FileInputStream inputStream = new FileInputStream(htmlFile); PDStream pdStream = new PDStream(document, inputStream); // Set the media box of the page PDRectangle mediaBox = page.getMediaBox(); contentStream.addRect(mediaBox.getLowerLeftX(), mediaBox.getLowerLeftY(), mediaBox.getWidth(), mediaBox.getHeight()); contentStream.clip(); // Create a PDF renderer PDFRenderer renderer = new PDFRenderer(document); renderer.setDocument(document); // Render the HTML file to PDF renderer.renderPageToStream(renderer.getCurrentPageNo(), pdStream); // Close the content stream and the document contentStream.close(); document.save(new FileOutputStream(pdfFilePath)); document.close(); System.out.println("HTML converted to PDF successfully."); } catch (IOException e) { e.printStackTrace(); } } } ``` 请确保将 `path/to/input.html` 替换为要换的 HTML 文件的路径,将 `path/to/output.pdf` 替换为保存生成的 PDF 文件的路径。运行此代码将生成一个包含 HTML 内容的 PDF 文件
评论 6
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值